Cargando...
Miniatura
Fecha
2025-02-23
Derechos de acceso
info:eu-repo/semantics/openAccess
Título de la revista
ISSN de la revista
Título del volumen
Editorial

Citas

plumx
Proyectos de investigación
Unidades organizativas
Número de la revista
Resumen
En el campo de las Humanidades Digitales, la automatización de procesos de extracción y análisis de información resulta esencial para optimizar el estudio de textos históricos. Este trabajo desarrolla un dataset de preguntas y respuestas a partir del contenido del Diario de Madrid, con el objetivo de sintetizar la información y mejorar su accesibilidad. El propósito principal de la investigación es evaluar la capacidad de los modelos de lenguaje más avanzados para generar preguntas y respuestas de manera automática en un corpus histórico. Para ello, se emplearon modelos como GPT-3.5-turbo, GPT-4o-mini y Mistral-8x7B-Instruct-v0.1, los cuales fueron sometidos a un análisis comparativo para determinar su eficacia en la generación de preguntas coherentes y respuestas precisas basadas en el corpus CLARA-DM. La evaluación del desempeño de estos modelos se llevó a cabo mediante métricas estándar como BLEU y ROUGE, así como con tres métricas adicionales proporcionadas por LLamaIndex, lo que permitió un análisis más detallado de la calidad de las respuestas generadas. Además de medir la fidelidad y relevancia de las respuestas, se consideró la corrección semántica y gramatical de las preguntas formuladas. Los resultados obtenidos fueron analizados en profundidad identificando tanto las ventajas como las limitaciones de cada modelo en este contexto. Se destacan los retos inherentes a la aplicación de modelos de lenguaje en la interpretación de textos históricos, así como las mejoras potenciales en futuras implementaciones. Por último, para asegurar que este trabajo pueda ser util para otros investigadores, tanto los códigos como el dataset generado están disponibles en GitHub.
In the field of Digital Humanities, automating information extraction and analysis processes is essential for optimizing the study of historical texts. This work develops a question-answer dataset based on the content of the Diario de Madrid, aiming to synthesize information and improve its accessibility. The primary objective of this research is to evaluate the ability of stateof-the-art language models to automatically generate questions and answers from a historical corpus. To this end, models such as GPT-3.5-turbo, GPT-4o-mini, and Mistral-8x7B-Instruct-v0.1 were employed and subjected to a comparative analysis to assess their effectiveness in generating coherent questions and accurate answers based on the CLARA-DM corpus. The performance of these models was evaluated using standard metrics such as BLEU and ROUGE, along with three additional metrics provided by LLamaIndex, enabling a more detailed assessment of the quality of the generated responses. In addition to measuring fidelity and relevance, the semantic and grammatical correctness of the generated questions was also considered. The results were analyzed in depth, identifying both the advantages and limitations of each model in this context. The study highlights the challenges inherent in applying language models to the interpretation of historical texts and explores potential strategies to enhance response accuracy.
Descripción
Categorías UNESCO
Palabras clave
Citación
López García, Celina. Trabajo fin de Master: "Modelos de lenguaje para la generación automática de preguntas y respuestas en textos históricos." Universidad Nacional de Educación a Distancia (UNED), 2025
Centro
E.T.S. de Ingeniería Informática
Departamento
Lenguajes y Sistemas Informáticos
Grupo de investigación
Grupo de innovación
Programa de doctorado
Cátedra
Datos de investigación relacionados
DOI