Macicior Michelena, Jaione2026-03-032026-03-032025-10Macicior Michelena, Jaione. Trabajo de Fin de Máster: «Del papel al pixel: experimentos para la digitalización de documentos históricos españoles». Universidad Nacional de Educación a Distancia (UJNED), 2025https://hdl.handle.net/20.500.14468/32013La digitalización de los documentos históricos en español plantea retos específicos derivados de la baja calidad de los escaneos, la diversidad tipográfica, la complejidad estructural de los documentos y la distancia en los procesos de transcripción y normalización. Este trabajo aborda dichos desafíos mediante la construcción de un corpus propio y la evaluación experimental de diferentes enfoques de reconocimiento óptico de caracteres (OCR) y análisis de layout. En una primera fase, se realizaron experimentos en el marco de la tarea compartida PastReader (IberLEF 2025), utilizando modelos consolidados como Tesseract y sistemas multimodales como Granite, lo que permitió identificar limitaciones asociadas a la calidad del corpus y a la consistencia del ground truth. A partir de esas conclusiones, se ha desarrollado una segunda fase experimental basada en la creación de un nuevo corpus manualmente anotado y en la exploración de modelos recientes como TrOCR y DocLayoutYOLO, orientados tanao a la transcripción como a la segmentación estructural. La evaluación se llevó a cabo mediante métricas cuantitativas y análisis cualitativos, poniendo en relieve el impacto de la segmentación previa en la mejora del reconocimiento. Los resultados muestran que la calidad y coherencia del corpus resultan determinantes para el rendimiento de los modelos y que los enfoques basados en aprendizaje profundo ofrecen ventajas significativas frente a los métodos tradicionales, especialmente cuando integran OCR y layout de manera conjunta. No obstante, el tamaño limitado del corpus, la heterogeneidad de los documentos y las restricciones de recursos constituyen limitaciones relevantes. Este trabajo contribuye así al avance en la digitalización de fuentes hemerográficas en español y sienta las bases para futuros desarrollos de modelos más robustos y corpus de mayor alcance en el ámbito de las humanidades digitales.The digitization of historical documents in Spanish poses specific challenges due to the poor quality of the scans, typographical diversity, the structural complexity of the documents, and the linguistic distance from contemporary Spanish, which introduces additional difficulties in the transcription and normalization processes. This work addresses these challenges by building a proprietary corpus and experimentally evaluating different approaches to optical character recognition (OCR) and layout analysis. In the first phase, experiments were carried out within the framework of the PastReader IberLEF 2025 shared task, using established models such as Tesseract and multimodal systems such as Granite, which made it possible to identify limitations associated with the quality of the corpus and the consistency of the ground truth. Based on these conclusions, a second experimental phase was developed based on the creation of a new manually annotated corpus and the exploration of recent models such as TrOCR and DocLayoutYOLO, aimed at both transcription and structural segmentation. The evaluation was carried out using quantitative metrics and qualitative analyses, highlighting the impact of prior segmentation on recognition improvement. The results show that the quality and consistency of the corpus are decisive for the performance of the models and that deep learning-based approaches offer significant advantages over traditional methods, especially when they integrate OCR and layout together. However, the limited size of the corpus, the heterogeneity of the documents, and resource constraints are significant limitations. This work thus contributes to the advancement of the digitization of Spanish newspaper sources and lays the foundation for future developments of more robust models and larger corpora in the field of digital humanities.esinfo:eu-repo/semantics/openAccess1203 Ciencia de los ordenadoresDel papel al pixel: experimentos para la digitalización de documentos históricos españolestesis de maestríaHumanidades DigitalesOCRLayoutTranskribusTesseractGraniteTrOCRDocLayoutDigital HumanitiesOCRLayoutTranskribusTesseractGraniteTrOCRDocLayout