Publicación:
Extracción de entidades de ubicación en textos clínicos en español mediante técnicas de procesamiento del lenguaje natural

dc.contributor.authorGaritano López de Uralde, Irati
dc.contributor.directorMartínez Unanue, Raquel
dc.date.accessioned2026-01-29T15:07:27Z
dc.date.available2026-01-29T15:07:27Z
dc.date.issued2025-09
dc.description.abstractEste trabajo aborda el reconocimiento automático de entidades de ubicación en informes clínicos en español, en el marco de la Subtarea 1 del reto MEDDOPLACE, que presenta un marco experimental para abordar diversas tareas relacionadas con la identificación de lugares. Para ello, se ha realizado un análisis comparativo entre un modelo de aprendizaje tradicional, CRF, y modelos de lenguaje preentrenados basados en Transformers. En concreto, se han utilizado modelos de dominio general como BETO y modelos especializados en el dominio biomédico como EriBERTa, PlanTL-RoBERTa o PlanTL-Longformer. Además, se han explorado técnicas de aumento de datos mediante traducción automática y generación de paráfrasis. Los resultados muestran una clara superioridad de los modelos Transformer, destacando PlanTL-Longformer como el mejor modelo con un valor F1 superior al 0.87. También se muestra que la paráfrasis mejora ligeramente el rendimiento, mientras que las traducciones automáticas empeoran los resultados. Este trabajo demuestra la eficacia de los modelos preentrenados en el procesamiento de textos clínico en español y propone varias líneas futuras para mejorar la detección de entidades de ubicación en entornos médicos.es
dc.description.abstractThis work addresses the automatic recognition of location entities in Spanish clinical reports, within the framework of Subtask 1 of the MEDDOPLACE challenge, which provides an experimental setting for location-related entity recognition. A comparative analysis has been carried out between a traditional approach based on CRF, and pretrained Transformerbased language models. In particular, general-domain models such as BETO were compared against biomedical domain-specific models like EriBERTa, PlanTL-RoBERTa and PlanTLLongformer. In addition, data augmentation techniques were explored through automatic translation and paraphrase generation. The results show a clear superiority of Transformerbased models, with PlanTL-Longformer achieving the best performance, reaching an F1 score above 0.87. Furthermore, paraphrase-based augmentation slightly improves results, while automatic translation tends to degrade performance. This study highlights the effectiveness of pretrained language models for processing Spanish clinical texts and suggests several future directions to improve the detection of location entities in medical contexts.en
dc.description.provenanceMade available in DSpace on 2026-01-29T15:07:27Z (GMT). No. of bitstreams: 1 Extracción de entidades de ubicación en textos clínicos en español mediante técnicas de procesamiento del lenguaje natural. Irati Garitano López de Uralde.pdf: 1407974 bytes, checksum: e10c3f20b62dd3f3a4eb34ab085ca0a3 (MD5) Previous issue date: 2025-09en
dc.identifier.citationGaritano López de Uralde, Irati. Trabajo de fin Máster: "Extracción de entidades de ubicación en textos clínicos en español mediante técnicas de procesamiento del lenguaje natural." Universidad Nacional de Educación a Distancia (UNED), 2025
dc.identifier.urihttps://hdl.handle.net/20.500.14468/31640
dc.language.isoes
dc.relation.centerE.T.S. de Ingeniería Informática
dc.relation.degreeMáster Universitario en Tecnologías del Lenguaje
dc.relation.departmentLenguajes y Sistemas Informáticos
dc.rightsinfo:eu-repo/semantics/openAccess
dc.rights.urihttp://creativecommons.org/licenses/by-nc-nd/4.0/deed.es
dc.subject1203 Ciencia de los ordenadores
dc.subject.keywordsNER clínicoes
dc.subject.keywordsEntidades de ubicaciónes
dc.subject.keywordsProcesamiento del Lenguaje Naturales
dc.subject.keywordsModelos Transformeres
dc.subject.keywordsBERTes
dc.subject.keywordsAumento de datoses
dc.subject.keywordsCampaña de evaluación MEDDOPLACEes
dc.subject.keywordsclinical NERen
dc.subject.keywordsLocation entitiesen
dc.subject.keywordsNatural Language Processingen
dc.subject.keywordsTransformer modelsen
dc.subject.keywordsBERTen
dc.subject.keywordsData augmentationen
dc.subject.keywordsEvaluation campaign MEDDOPLACEen
dc.titleExtracción de entidades de ubicación en textos clínicos en español mediante técnicas de procesamiento del lenguaje naturales
dc.typetesis de maestríaes
dc.typemaster thesisen
dspace.entity.typePublication
Archivos
Bloque original
Mostrando 1 - 1 de 1
Cargando...
Miniatura
Nombre:
Extracción de entidades de ubicación en textos clínicos en español mediante técnicas de procesamiento del lenguaje natural. Irati Garitano López de Uralde.pdf
Tamaño:
1.34 MB
Formato:
Adobe Portable Document Format
Bloque de licencias
Mostrando 1 - 1 de 1
No hay miniatura disponible
Nombre:
license.txt
Tamaño:
3.62 KB
Formato:
Item-specific license agreed to upon submission
Descripción: