Publicación: Segmentación de documentos clínicos en español mediante técnicas de procesamiento del lenguaje
| dc.contributor.author | Ramírez Arrabe, Alicia | |
| dc.contributor.director | Martínez Unanue, Raquel | |
| dc.date.accessioned | 2026-01-27T15:48:44Z | |
| dc.date.available | 2026-01-27T15:48:44Z | |
| dc.date.issued | 2025-02 | |
| dc.description.abstract | La segmentación de textos en el dominio clínico tiene como objetivo identificar las secciones en las que se estructura la información de dichos documentos. El desarrollo de una herramienta de segmentación de este tipo de textos podría ser un recurso valioso para facilitar la labor de los profesionales de la salud, así como para mejorar la implementación de otros sistemas de Procesamiento del Lenguaje Natural (PLN). En este proyecto se propone la implementación de un modelo de segmentación bajo el marco experimental de la tarea compartida ClinAIS 2023. Se aplican y evaluan diferentes técnicas avanzadas de PLN, utilizando modelos contextuales basados en Transformers y diversos métodos de aumento de datos. A lo largo de esta memoria, se realiza una revisión del estado del arte y los contenidos preliminares relacionados con la tarea. Se lleva a cabo un estudio exhaustivo del corpus y se definen cuatro esquemas de anotación para etiquetar las diferentes secciones en las que se dividen los textos. Además, se seleccionan cuatro modelos preentrenados y se crean ocho conjuntos de datos aumentados basados en tres técnicas: retrotraducción, generación de sinónimos y producción de paráfrasis. Finalmente, se aplica un posprocesado a las predicciones basado en heurísticas. Tras evaluar todos los sistemas desarrollados, el mejor modelo de segmentación obtiene un valor B2 weighted de 0,8237 en el conjunto de desarrollo y 0,7965 en el conjunto de evaluación. Los mejores resultados son obtenidos por un modelo RoBERTa preentrenado con textos del dominio en español, un esquema de anotación con 21 etiquetas que distingue entre el inicio, interior y final de cada segmento, el conjunto de datos aumentado basado en la generación de sinónimos con mayor similitud del coseno y la aplicación del posprocesado. | es |
| dc.description.abstract | Clinical text segmentation aims to identify the sections in which the information of such documents is structured. The development of a segmentation tool for this type of texts could constitute a valuable resource to assist health professionals, as well as to improve and enrich other Natural Language Processing (NLP) systems. This project intends to implement a segmentation model within the experimental framework of the ClinAIS 2023 shared task. Advanced NLP techniques are applied and evaluated, including contextual models based on Transformers and several data augmentation methods. Throughout this report, a review of the state-of-the-art and the preliminary concepts related to the task is conducted. An in-depth analysis of the corpus is performed, and four annotation schemes are defined to label the different sections into which the texts are divided. Additionally, four pre-trained models are selected, and eight augmented datasets are generated based on three techniques: back-translation, synonym replacement and paraphrase generation. Finally, some heuristics-based post-processing is applied to the predictions. After evaluating all the developed systems, the best segmentation model achieves a B2 weighted score of 0.8237 on the development set and 0.7965 on the evaluation set. The best results are obtained by a RoBERTa model pre-trained on Spanish clinical texts, a 21-label annotation scheme that distinguishes between the beginning, inside and ending of each segment, the augmented dataset based on synonym generation using the highest cosine similarity, and the application of the post-processing method. | en |
| dc.description.provenance | Made available in DSpace on 2026-01-27T15:48:44Z (GMT). No. of bitstreams: 1 Segmentación de documentos clínicos en español mediante técnicas de procesamiento del lenguaje. Ramírez Arrabe, Alicia.pdf: 1558439 bytes, checksum: 1f1c6797f6f309a20347f6822c78224b (MD5) Previous issue date: 2025-02 | en |
| dc.identifier.citation | Ramírez Arrabé, Alicia. Trabajo fin de Máster: "Segmentación de documentos clínicos en español mediante técnicas de procesamiento del lenguaje natural". Universidad Nacional de Educación a Distancia (UNED), 2025 | |
| dc.identifier.uri | https://hdl.handle.net/20.500.14468/31590 | |
| dc.language.iso | es | |
| dc.relation.center | E.T.S. de Ingeniería Informática | |
| dc.relation.degree | Máster Universitario en Investigación en Tecnologías Industriales | |
| dc.relation.department | Lenguajes y Sistemas Informáticos | |
| dc.rights | info:eu-repo/semantics/openAccess | |
| dc.rights.uri | http://creativecommons.org/licenses/by-nc-nd/4.0/deed.es | |
| dc.subject | 1203 Ciencia de los ordenadores | |
| dc.subject.keywords | Procesamiento del Lenguaje Natural | es |
| dc.subject.keywords | Identificación automática de secciones | es |
| dc.subject.keywords | Modelos contextuales preentrenados | es |
| dc.subject.keywords | Clasificación de tokens | es |
| dc.subject.keywords | Aumento de datos | es |
| dc.subject.keywords | Esquemas de anotación | es |
| dc.subject.keywords | Natural Language Processing | en |
| dc.subject.keywords | Automatic section identification | en |
| dc.subject.keywords | Pre-trained contextual models | en |
| dc.subject.keywords | Token classification | en |
| dc.subject.keywords | Data augmentation | en |
| dc.subject.keywords | Annotation schemes | en |
| dc.title | Segmentación de documentos clínicos en español mediante técnicas de procesamiento del lenguaje | es |
| dc.type | tesis de maestría | es |
| dc.type | master thesis | en |
| dspace.entity.type | Publication | |
| relation.isAuthorOfPublication | 3090d1c2-4558-4454-965d-589e08109deb | |
| relation.isAuthorOfPublication.latestForDiscovery | 3090d1c2-4558-4454-965d-589e08109deb |
Archivos
Bloque original
1 - 1 de 1
Cargando...
- Nombre:
- Segmentación de documentos clínicos en español mediante técnicas de procesamiento del lenguaje. Ramírez Arrabe, Alicia.pdf
- Tamaño:
- 1.49 MB
- Formato:
- Adobe Portable Document Format
Bloque de licencias
1 - 1 de 1
No hay miniatura disponible
- Nombre:
- license.txt
- Tamaño:
- 3.62 KB
- Formato:
- Item-specific license agreed to upon submission
- Descripción: