Gil, Álvaro Francisco2026-02-032026-02-032025-09-21Gil, Álvaro Francisco. Trabajo de Fin de Máster: «MentorEval: the largest benchmark for automated student grading». Universidad Nacional de Educación a Distancia (UNED), 2025https://hdl.handle.net/20.500.14468/31689Los modelos de lenguaje de gran tamaño se utilizan cada vez más para la evaluación educativa, y estudios recientes destacan su capacidad para aproximarse a la calificación humana [1, 2, 3, 4, 5, 6]. Sin embargo, la mayoría de estos trabajos se basan en conjuntos de datos privados o muy específicos, y actualmente no existe un benchmark multilingüe que permita una evaluación sistemática y transparente a través de distintas tareas e idiomas [7]. Para abordar esta limitación, presentamos MentorEval, la colección más amplia existente de datasets con respuestas de alumnos y correcciones. Concebida como un proyecto en crecimiento, MentorEval integra seis conjuntos de datos públicos en inglés, portugués y árabe, estandarizados bajo un esquema común y disponibles en Hugging Face. Basándose en LightEval, define 203 tareas detalladas y permite la experimentación modular con prompts, modelos y métricas de evaluación. Los resultados se publican automáticamente en una página web de acceso abierto, garantizando reproducibilidad y fomentando contribuciones colaborativas. Para demostrar su utilidad, evaluamos gpt-4o-mini bajo distintas condiciones de prompting. Los experimentos muestran que la inclusión de rúbricas, ejemplos, respuestas ideales y razonamiento explicativo en los prompts mejora de manera consistente el rendimiento.Large language models (LLMs) are increasingly applied to educational assessment, with recent studies highlighting their potential to approximate human grading [1, 2, 3, 4, 5, 6]. However, existing work relies on private or highly specific datasets, and no multilingual benchmark currently enables systematic, transparent evaluation across tasks and languages [7]. We address this gap with MentorEval, the largest unified collection of student assessment datasets to date, conceived as a growing project that will continuously incorporate new datasets. MentorEval aggregates six public datasets in English, Portuguese, and Arabic, harmonized under a shared schema and available on Hugging Face. Building on LightEval, it defines 203 fine-grained tasks and supports modular experimentation with prompts, models, and evaluation metrics. Results are automatically displayed on an open-access webpage, ensuring reproducibility and fostering collaborative contributions. To demonstrate its utility, we benchmarked gpt-4o-mini under different prompting conditions. The experiments show that augmenting prompts with rubrics, examples, ideal answers, and explanatory reasoning consistently improves performance.eninfo:eu-repo/semantics/openAccess3304 Tecnología de los ordenadoresMentorEval: the largest benchmark for automated student gradingtesis de maestríaEvaluación automática de exámenesLLMsBenchmark multilingüeStudent assessmentLLM evaluationMultilingual benchmark