Garitano López de Uralde, Irati2026-01-292026-01-292025-09Garitano López de Uralde, Irati. Trabajo de fin Máster: "Extracción de entidades de ubicación en textos clínicos en español mediante técnicas de procesamiento del lenguaje natural." Universidad Nacional de Educación a Distancia (UNED), 2025https://hdl.handle.net/20.500.14468/31640Este trabajo aborda el reconocimiento automático de entidades de ubicación en informes clínicos en español, en el marco de la Subtarea 1 del reto MEDDOPLACE, que presenta un marco experimental para abordar diversas tareas relacionadas con la identificación de lugares. Para ello, se ha realizado un análisis comparativo entre un modelo de aprendizaje tradicional, CRF, y modelos de lenguaje preentrenados basados en Transformers. En concreto, se han utilizado modelos de dominio general como BETO y modelos especializados en el dominio biomédico como EriBERTa, PlanTL-RoBERTa o PlanTL-Longformer. Además, se han explorado técnicas de aumento de datos mediante traducción automática y generación de paráfrasis. Los resultados muestran una clara superioridad de los modelos Transformer, destacando PlanTL-Longformer como el mejor modelo con un valor F1 superior al 0.87. También se muestra que la paráfrasis mejora ligeramente el rendimiento, mientras que las traducciones automáticas empeoran los resultados. Este trabajo demuestra la eficacia de los modelos preentrenados en el procesamiento de textos clínico en español y propone varias líneas futuras para mejorar la detección de entidades de ubicación en entornos médicos.This work addresses the automatic recognition of location entities in Spanish clinical reports, within the framework of Subtask 1 of the MEDDOPLACE challenge, which provides an experimental setting for location-related entity recognition. A comparative analysis has been carried out between a traditional approach based on CRF, and pretrained Transformerbased language models. In particular, general-domain models such as BETO were compared against biomedical domain-specific models like EriBERTa, PlanTL-RoBERTa and PlanTLLongformer. In addition, data augmentation techniques were explored through automatic translation and paraphrase generation. The results show a clear superiority of Transformerbased models, with PlanTL-Longformer achieving the best performance, reaching an F1 score above 0.87. Furthermore, paraphrase-based augmentation slightly improves results, while automatic translation tends to degrade performance. This study highlights the effectiveness of pretrained language models for processing Spanish clinical texts and suggests several future directions to improve the detection of location entities in medical contexts.esinfo:eu-repo/semantics/openAccess1203 Ciencia de los ordenadoresExtracción de entidades de ubicación en textos clínicos en español mediante técnicas de procesamiento del lenguaje naturaltesis de maestríaNER clínicoEntidades de ubicaciónProcesamiento del Lenguaje NaturalModelos TransformerBERTAumento de datosCampaña de evaluación MEDDOPLACEclinical NERLocation entitiesNatural Language ProcessingTransformer modelsBERTData augmentationEvaluation campaign MEDDOPLACE