Publicación:
Segmentación de documentos clínicos en español mediante técnicas de procesamiento del lenguaje

dc.contributor.authorRamírez Arrabe, Alicia
dc.contributor.directorMartínez Unanue, Raquel
dc.date.accessioned2026-01-27T15:48:44Z
dc.date.available2026-01-27T15:48:44Z
dc.date.issued2025-02
dc.description.abstractLa segmentación de textos en el dominio clínico tiene como objetivo identificar las secciones en las que se estructura la información de dichos documentos. El desarrollo de una herramienta de segmentación de este tipo de textos podría ser un recurso valioso para facilitar la labor de los profesionales de la salud, así como para mejorar la implementación de otros sistemas de Procesamiento del Lenguaje Natural (PLN). En este proyecto se propone la implementación de un modelo de segmentación bajo el marco experimental de la tarea compartida ClinAIS 2023. Se aplican y evaluan diferentes técnicas avanzadas de PLN, utilizando modelos contextuales basados en Transformers y diversos métodos de aumento de datos. A lo largo de esta memoria, se realiza una revisión del estado del arte y los contenidos preliminares relacionados con la tarea. Se lleva a cabo un estudio exhaustivo del corpus y se definen cuatro esquemas de anotación para etiquetar las diferentes secciones en las que se dividen los textos. Además, se seleccionan cuatro modelos preentrenados y se crean ocho conjuntos de datos aumentados basados en tres técnicas: retrotraducción, generación de sinónimos y producción de paráfrasis. Finalmente, se aplica un posprocesado a las predicciones basado en heurísticas. Tras evaluar todos los sistemas desarrollados, el mejor modelo de segmentación obtiene un valor B2 weighted de 0,8237 en el conjunto de desarrollo y 0,7965 en el conjunto de evaluación. Los mejores resultados son obtenidos por un modelo RoBERTa preentrenado con textos del dominio en español, un esquema de anotación con 21 etiquetas que distingue entre el inicio, interior y final de cada segmento, el conjunto de datos aumentado basado en la generación de sinónimos con mayor similitud del coseno y la aplicación del posprocesado.es
dc.description.abstractClinical text segmentation aims to identify the sections in which the information of such documents is structured. The development of a segmentation tool for this type of texts could constitute a valuable resource to assist health professionals, as well as to improve and enrich other Natural Language Processing (NLP) systems. This project intends to implement a segmentation model within the experimental framework of the ClinAIS 2023 shared task. Advanced NLP techniques are applied and evaluated, including contextual models based on Transformers and several data augmentation methods. Throughout this report, a review of the state-of-the-art and the preliminary concepts related to the task is conducted. An in-depth analysis of the corpus is performed, and four annotation schemes are defined to label the different sections into which the texts are divided. Additionally, four pre-trained models are selected, and eight augmented datasets are generated based on three techniques: back-translation, synonym replacement and paraphrase generation. Finally, some heuristics-based post-processing is applied to the predictions. After evaluating all the developed systems, the best segmentation model achieves a B2 weighted score of 0.8237 on the development set and 0.7965 on the evaluation set. The best results are obtained by a RoBERTa model pre-trained on Spanish clinical texts, a 21-label annotation scheme that distinguishes between the beginning, inside and ending of each segment, the augmented dataset based on synonym generation using the highest cosine similarity, and the application of the post-processing method.en
dc.description.provenanceMade available in DSpace on 2026-01-27T15:48:44Z (GMT). No. of bitstreams: 1 Segmentación de documentos clínicos en español mediante técnicas de procesamiento del lenguaje. Ramírez Arrabe, Alicia.pdf: 1558439 bytes, checksum: 1f1c6797f6f309a20347f6822c78224b (MD5) Previous issue date: 2025-02en
dc.identifier.citationRamírez Arrabé, Alicia. Trabajo fin de Máster: "Segmentación de documentos clínicos en español mediante técnicas de procesamiento del lenguaje natural". Universidad Nacional de Educación a Distancia (UNED), 2025
dc.identifier.urihttps://hdl.handle.net/20.500.14468/31590
dc.language.isoes
dc.relation.centerE.T.S. de Ingeniería Informática
dc.relation.degreeMáster Universitario en Investigación en Tecnologías Industriales
dc.relation.departmentLenguajes y Sistemas Informáticos
dc.rightsinfo:eu-repo/semantics/openAccess
dc.rights.urihttp://creativecommons.org/licenses/by-nc-nd/4.0/deed.es
dc.subject1203 Ciencia de los ordenadores
dc.subject.keywordsProcesamiento del Lenguaje Naturales
dc.subject.keywordsIdentificación automática de seccioneses
dc.subject.keywordsModelos contextuales preentrenadoses
dc.subject.keywordsClasificación de tokenses
dc.subject.keywordsAumento de datoses
dc.subject.keywordsEsquemas de anotaciónes
dc.subject.keywordsNatural Language Processingen
dc.subject.keywordsAutomatic section identificationen
dc.subject.keywordsPre-trained contextual modelsen
dc.subject.keywordsToken classificationen
dc.subject.keywordsData augmentationen
dc.subject.keywordsAnnotation schemesen
dc.titleSegmentación de documentos clínicos en español mediante técnicas de procesamiento del lenguajees
dc.typetesis de maestríaes
dc.typemaster thesisen
dspace.entity.typePublication
relation.isAuthorOfPublication3090d1c2-4558-4454-965d-589e08109deb
relation.isAuthorOfPublication.latestForDiscovery3090d1c2-4558-4454-965d-589e08109deb
Archivos
Bloque original
Mostrando 1 - 1 de 1
Cargando...
Miniatura
Nombre:
Segmentación de documentos clínicos en español mediante técnicas de procesamiento del lenguaje. Ramírez Arrabe, Alicia.pdf
Tamaño:
1.49 MB
Formato:
Adobe Portable Document Format
Bloque de licencias
Mostrando 1 - 1 de 1
No hay miniatura disponible
Nombre:
license.txt
Tamaño:
3.62 KB
Formato:
Item-specific license agreed to upon submission
Descripción: