Persona: Ramírez Arrabe, Alicia
Cargando...
Dirección de correo electrónico
aramirez@lsi.uned.es
ORCID
Fecha de nacimiento
Proyectos de investigación
Unidades organizativas
Puesto de trabajo
Apellidos
Ramírez Arrabe
Nombre de pila
Alicia
Nombre
1 resultados
Resultados de la búsqueda
Mostrando 1 - 1 de 1
Publicación Segmentación de documentos clínicos en español mediante técnicas de procesamiento del lenguaje(2025-02) Ramírez Arrabe, Alicia; Martínez Unanue, RaquelLa segmentación de textos en el dominio clínico tiene como objetivo identificar las secciones en las que se estructura la información de dichos documentos. El desarrollo de una herramienta de segmentación de este tipo de textos podría ser un recurso valioso para facilitar la labor de los profesionales de la salud, así como para mejorar la implementación de otros sistemas de Procesamiento del Lenguaje Natural (PLN). En este proyecto se propone la implementación de un modelo de segmentación bajo el marco experimental de la tarea compartida ClinAIS 2023. Se aplican y evaluan diferentes técnicas avanzadas de PLN, utilizando modelos contextuales basados en Transformers y diversos métodos de aumento de datos. A lo largo de esta memoria, se realiza una revisión del estado del arte y los contenidos preliminares relacionados con la tarea. Se lleva a cabo un estudio exhaustivo del corpus y se definen cuatro esquemas de anotación para etiquetar las diferentes secciones en las que se dividen los textos. Además, se seleccionan cuatro modelos preentrenados y se crean ocho conjuntos de datos aumentados basados en tres técnicas: retrotraducción, generación de sinónimos y producción de paráfrasis. Finalmente, se aplica un posprocesado a las predicciones basado en heurísticas. Tras evaluar todos los sistemas desarrollados, el mejor modelo de segmentación obtiene un valor B2 weighted de 0,8237 en el conjunto de desarrollo y 0,7965 en el conjunto de evaluación. Los mejores resultados son obtenidos por un modelo RoBERTa preentrenado con textos del dominio en español, un esquema de anotación con 21 etiquetas que distingue entre el inicio, interior y final de cada segmento, el conjunto de datos aumentado basado en la generación de sinónimos con mayor similitud del coseno y la aplicación del posprocesado.