Cargando...
Miniatura
Fecha
2025-09
Derechos de acceso
info:eu-repo/semantics/openAccess
Título de la revista
ISSN de la revista
Título del volumen
Editorial

Citas

plumx
Proyectos de investigación
Unidades organizativas
Número de la revista
Resumen
Este trabajo aborda el reconocimiento automático de entidades de ubicación en informes clínicos en español, en el marco de la Subtarea 1 del reto MEDDOPLACE, que presenta un marco experimental para abordar diversas tareas relacionadas con la identificación de lugares. Para ello, se ha realizado un análisis comparativo entre un modelo de aprendizaje tradicional, CRF, y modelos de lenguaje preentrenados basados en Transformers. En concreto, se han utilizado modelos de dominio general como BETO y modelos especializados en el dominio biomédico como EriBERTa, PlanTL-RoBERTa o PlanTL-Longformer. Además, se han explorado técnicas de aumento de datos mediante traducción automática y generación de paráfrasis. Los resultados muestran una clara superioridad de los modelos Transformer, destacando PlanTL-Longformer como el mejor modelo con un valor F1 superior al 0.87. También se muestra que la paráfrasis mejora ligeramente el rendimiento, mientras que las traducciones automáticas empeoran los resultados. Este trabajo demuestra la eficacia de los modelos preentrenados en el procesamiento de textos clínico en español y propone varias líneas futuras para mejorar la detección de entidades de ubicación en entornos médicos.
This work addresses the automatic recognition of location entities in Spanish clinical reports, within the framework of Subtask 1 of the MEDDOPLACE challenge, which provides an experimental setting for location-related entity recognition. A comparative analysis has been carried out between a traditional approach based on CRF, and pretrained Transformerbased language models. In particular, general-domain models such as BETO were compared against biomedical domain-specific models like EriBERTa, PlanTL-RoBERTa and PlanTLLongformer. In addition, data augmentation techniques were explored through automatic translation and paraphrase generation. The results show a clear superiority of Transformerbased models, with PlanTL-Longformer achieving the best performance, reaching an F1 score above 0.87. Furthermore, paraphrase-based augmentation slightly improves results, while automatic translation tends to degrade performance. This study highlights the effectiveness of pretrained language models for processing Spanish clinical texts and suggests several future directions to improve the detection of location entities in medical contexts.
Descripción
Categorías UNESCO
Palabras clave
NER clínico, Entidades de ubicación, Procesamiento del Lenguaje Natural, Modelos Transformer, BERT, Aumento de datos, Campaña de evaluación MEDDOPLACE, clinical NER, Location entities, Natural Language Processing, Transformer models, BERT, Data augmentation, Evaluation campaign MEDDOPLACE
Citación
Garitano López de Uralde, Irati. Trabajo de fin Máster: "Extracción de entidades de ubicación en textos clínicos en español mediante técnicas de procesamiento del lenguaje natural." Universidad Nacional de Educación a Distancia (UNED), 2025
Centro
E.T.S. de Ingeniería Informática
Departamento
Lenguajes y Sistemas Informáticos
Grupo de investigación
Grupo de innovación
Programa de doctorado
Cátedra
Datos de investigación relacionados
DOI