Cargando...
Miniatura
Fecha
2025-10
Derechos de acceso
info:eu-repo/semantics/openAccess
Título de la revista
ISSN de la revista
Título del volumen
Editorial

Citas

plumx
Proyectos de investigación
Unidades organizativas
Número de la revista
Resumen
La digitalización de los documentos históricos en español plantea retos específicos derivados de la baja calidad de los escaneos, la diversidad tipográfica, la complejidad estructural de los documentos y la distancia en los procesos de transcripción y normalización. Este trabajo aborda dichos desafíos mediante la construcción de un corpus propio y la evaluación experimental de diferentes enfoques de reconocimiento óptico de caracteres (OCR) y análisis de layout. En una primera fase, se realizaron experimentos en el marco de la tarea compartida PastReader (IberLEF 2025), utilizando modelos consolidados como Tesseract y sistemas multimodales como Granite, lo que permitió identificar limitaciones asociadas a la calidad del corpus y a la consistencia del ground truth. A partir de esas conclusiones, se ha desarrollado una segunda fase experimental basada en la creación de un nuevo corpus manualmente anotado y en la exploración de modelos recientes como TrOCR y DocLayoutYOLO, orientados tanao a la transcripción como a la segmentación estructural. La evaluación se llevó a cabo mediante métricas cuantitativas y análisis cualitativos, poniendo en relieve el impacto de la segmentación previa en la mejora del reconocimiento. Los resultados muestran que la calidad y coherencia del corpus resultan determinantes para el rendimiento de los modelos y que los enfoques basados en aprendizaje profundo ofrecen ventajas significativas frente a los métodos tradicionales, especialmente cuando integran OCR y layout de manera conjunta. No obstante, el tamaño limitado del corpus, la heterogeneidad de los documentos y las restricciones de recursos constituyen limitaciones relevantes. Este trabajo contribuye así al avance en la digitalización de fuentes hemerográficas en español y sienta las bases para futuros desarrollos de modelos más robustos y corpus de mayor alcance en el ámbito de las humanidades digitales.
The digitization of historical documents in Spanish poses specific challenges due to the poor quality of the scans, typographical diversity, the structural complexity of the documents, and the linguistic distance from contemporary Spanish, which introduces additional difficulties in the transcription and normalization processes. This work addresses these challenges by building a proprietary corpus and experimentally evaluating different approaches to optical character recognition (OCR) and layout analysis. In the first phase, experiments were carried out within the framework of the PastReader IberLEF 2025 shared task, using established models such as Tesseract and multimodal systems such as Granite, which made it possible to identify limitations associated with the quality of the corpus and the consistency of the ground truth. Based on these conclusions, a second experimental phase was developed based on the creation of a new manually annotated corpus and the exploration of recent models such as TrOCR and DocLayoutYOLO, aimed at both transcription and structural segmentation. The evaluation was carried out using quantitative metrics and qualitative analyses, highlighting the impact of prior segmentation on recognition improvement. The results show that the quality and consistency of the corpus are decisive for the performance of the models and that deep learning-based approaches offer significant advantages over traditional methods, especially when they integrate OCR and layout together. However, the limited size of the corpus, the heterogeneity of the documents, and resource constraints are significant limitations. This work thus contributes to the advancement of the digitization of Spanish newspaper sources and lays the foundation for future developments of more robust models and larger corpora in the field of digital humanities.
Descripción
Categorías UNESCO
Palabras clave
Humanidades Digitales, OCR, Layout, Transkribus, Tesseract, Granite, TrOCR, DocLayout, Digital Humanities, OCR, Layout, Transkribus, Tesseract, Granite, TrOCR, DocLayout
Citación
Macicior Michelena, Jaione. Trabajo de Fin de Máster: «Del papel al pixel: experimentos para la digitalización de documentos históricos españoles». Universidad Nacional de Educación a Distancia (UJNED), 2025
Centro
Escuela Técnica Superior de Ingeniería Informática
Departamento
Lenguajes y Sistemas Informáticos
Grupo de investigación
Grupo de innovación
Programa de doctorado
Cátedra
Datos de investigación relacionados
DOI