Publicación:
Modelos de lenguaje para la generación automática de preguntas y respuestas en textos históricos.

dc.contributor.authorLópez García, Celina
dc.contributor.directorGarcía Serrano, Ana Mª
dc.date.accessioned2026-01-28T13:51:26Z
dc.date.available2026-01-28T13:51:26Z
dc.date.issued2025-02-23
dc.description.abstractEn el campo de las Humanidades Digitales, la automatización de procesos de extracción y análisis de información resulta esencial para optimizar el estudio de textos históricos. Este trabajo desarrolla un dataset de preguntas y respuestas a partir del contenido del Diario de Madrid, con el objetivo de sintetizar la información y mejorar su accesibilidad. El propósito principal de la investigación es evaluar la capacidad de los modelos de lenguaje más avanzados para generar preguntas y respuestas de manera automática en un corpus histórico. Para ello, se emplearon modelos como GPT-3.5-turbo, GPT-4o-mini y Mistral-8x7B-Instruct-v0.1, los cuales fueron sometidos a un análisis comparativo para determinar su eficacia en la generación de preguntas coherentes y respuestas precisas basadas en el corpus CLARA-DM. La evaluación del desempeño de estos modelos se llevó a cabo mediante métricas estándar como BLEU y ROUGE, así como con tres métricas adicionales proporcionadas por LLamaIndex, lo que permitió un análisis más detallado de la calidad de las respuestas generadas. Además de medir la fidelidad y relevancia de las respuestas, se consideró la corrección semántica y gramatical de las preguntas formuladas. Los resultados obtenidos fueron analizados en profundidad identificando tanto las ventajas como las limitaciones de cada modelo en este contexto. Se destacan los retos inherentes a la aplicación de modelos de lenguaje en la interpretación de textos históricos, así como las mejoras potenciales en futuras implementaciones. Por último, para asegurar que este trabajo pueda ser util para otros investigadores, tanto los códigos como el dataset generado están disponibles en GitHub.es
dc.description.abstractIn the field of Digital Humanities, automating information extraction and analysis processes is essential for optimizing the study of historical texts. This work develops a question-answer dataset based on the content of the Diario de Madrid, aiming to synthesize information and improve its accessibility. The primary objective of this research is to evaluate the ability of stateof-the-art language models to automatically generate questions and answers from a historical corpus. To this end, models such as GPT-3.5-turbo, GPT-4o-mini, and Mistral-8x7B-Instruct-v0.1 were employed and subjected to a comparative analysis to assess their effectiveness in generating coherent questions and accurate answers based on the CLARA-DM corpus. The performance of these models was evaluated using standard metrics such as BLEU and ROUGE, along with three additional metrics provided by LLamaIndex, enabling a more detailed assessment of the quality of the generated responses. In addition to measuring fidelity and relevance, the semantic and grammatical correctness of the generated questions was also considered. The results were analyzed in depth, identifying both the advantages and limitations of each model in this context. The study highlights the challenges inherent in applying language models to the interpretation of historical texts and explores potential strategies to enhance response accuracy.en
dc.description.provenanceMade available in DSpace on 2026-01-28T13:51:26Z (GMT). No. of bitstreams: 1 Modelos de lenguaje para la generación automática de preguntas y respuestas en textos históricos. Celina López García.pdf: 1690787 bytes, checksum: 10e37ff54de6b6d48fc4dc33bb4be7f5 (MD5) Previous issue date: 2025-02-23en
dc.identifier.citationLópez García, Celina. Trabajo fin de Master: "Modelos de lenguaje para la generación automática de preguntas y respuestas en textos históricos." Universidad Nacional de Educación a Distancia (UNED), 2025
dc.identifier.urihttps://hdl.handle.net/20.500.14468/31617
dc.language.isoes
dc.relation.centerE.T.S. de Ingeniería Informática
dc.relation.degreeMáster Universitario en Tecnologías del Lenguaje
dc.relation.departmentLenguajes y Sistemas Informáticos
dc.rightsinfo:eu-repo/semantics/openAccess
dc.rights.urihttp://creativecommons.org/licenses/by-nc-nd/4.0/deed.es
dc.subject1203 Ciencia de los ordenadores
dc.titleModelos de lenguaje para la generación automática de preguntas y respuestas en textos históricos.es
dc.typetesis de maestríaes
dc.typemaster thesisen
dspace.entity.typePublication
Archivos
Bloque original
Mostrando 1 - 1 de 1
Cargando...
Miniatura
Nombre:
Modelos de lenguaje para la generación automática de preguntas y respuestas en textos históricos. Celina López García.pdf
Tamaño:
1.61 MB
Formato:
Adobe Portable Document Format
Bloque de licencias
Mostrando 1 - 1 de 1
No hay miniatura disponible
Nombre:
license.txt
Tamaño:
3.62 KB
Formato:
Item-specific license agreed to upon submission
Descripción: