Publicación:
MentorEval: the largest benchmark for automated student grading

dc.contributor.authorGil, Álvaro Francisco
dc.contributor.directorFresno Fernández, Víctor Diego
dc.date.accessioned2026-02-03T12:29:32Z
dc.date.available2026-02-03T12:29:32Z
dc.date.issued2025-09-21
dc.description.abstractLos modelos de lenguaje de gran tamaño se utilizan cada vez más para la evaluación educativa, y estudios recientes destacan su capacidad para aproximarse a la calificación humana [1, 2, 3, 4, 5, 6]. Sin embargo, la mayoría de estos trabajos se basan en conjuntos de datos privados o muy específicos, y actualmente no existe un benchmark multilingüe que permita una evaluación sistemática y transparente a través de distintas tareas e idiomas [7]. Para abordar esta limitación, presentamos MentorEval, la colección más amplia existente de datasets con respuestas de alumnos y correcciones. Concebida como un proyecto en crecimiento, MentorEval integra seis conjuntos de datos públicos en inglés, portugués y árabe, estandarizados bajo un esquema común y disponibles en Hugging Face. Basándose en LightEval, define 203 tareas detalladas y permite la experimentación modular con prompts, modelos y métricas de evaluación. Los resultados se publican automáticamente en una página web de acceso abierto, garantizando reproducibilidad y fomentando contribuciones colaborativas. Para demostrar su utilidad, evaluamos gpt-4o-mini bajo distintas condiciones de prompting. Los experimentos muestran que la inclusión de rúbricas, ejemplos, respuestas ideales y razonamiento explicativo en los prompts mejora de manera consistente el rendimiento.es
dc.description.abstractLarge language models (LLMs) are increasingly applied to educational assessment, with recent studies highlighting their potential to approximate human grading [1, 2, 3, 4, 5, 6]. However, existing work relies on private or highly specific datasets, and no multilingual benchmark currently enables systematic, transparent evaluation across tasks and languages [7]. We address this gap with MentorEval, the largest unified collection of student assessment datasets to date, conceived as a growing project that will continuously incorporate new datasets. MentorEval aggregates six public datasets in English, Portuguese, and Arabic, harmonized under a shared schema and available on Hugging Face. Building on LightEval, it defines 203 fine-grained tasks and supports modular experimentation with prompts, models, and evaluation metrics. Results are automatically displayed on an open-access webpage, ensuring reproducibility and fostering collaborative contributions. To demonstrate its utility, we benchmarked gpt-4o-mini under different prompting conditions. The experiments show that augmenting prompts with rubrics, examples, ideal answers, and explanatory reasoning consistently improves performance.en
dc.description.provenanceMade available in DSpace on 2026-02-03T12:29:32Z (GMT). No. of bitstreams: 1 TFM. MentorEval the largest benchmark for automated student grading. Álvaro Francisco Gil.pdf: 1152367 bytes, checksum: 45d75364a2850eb2e5091b9820acb6ca (MD5) Previous issue date: 2025-09-21en
dc.identifier.citationGil, Álvaro Francisco. Trabajo de Fin de Máster: «MentorEval: the largest benchmark for automated student grading». Universidad Nacional de Educación a Distancia (UNED), 2025
dc.identifier.urihttps://hdl.handle.net/20.500.14468/31689
dc.language.isoen
dc.relation.centerE.T.S. de Ingeniería Informática
dc.relation.degreeMáster Universitario en Tecnologías del Lenguaje
dc.relation.departmentLenguajes y Sistemas Informáticos
dc.rightsinfo:eu-repo/semantics/openAccess
dc.rights.urihttp://creativecommons.org/licenses/by-nc-nd/4.0/deed.es
dc.subject3304 Tecnología de los ordenadores
dc.subject.keywordsEvaluación automática de exámeneses
dc.subject.keywordsLLMses
dc.subject.keywordsBenchmark multilingüees
dc.subject.keywordsStudent assessmenten
dc.subject.keywordsLLM evaluationen
dc.subject.keywordsMultilingual benchmarken
dc.titleMentorEval: the largest benchmark for automated student gradingen
dc.typetesis de maestríaes
dc.typemaster thesisen
dspace.entity.typePublication
Archivos
Bloque original
Mostrando 1 - 1 de 1
Cargando...
Miniatura
Nombre:
TFM. MentorEval the largest benchmark for automated student grading. Álvaro Francisco Gil.pdf
Tamaño:
1.1 MB
Formato:
Adobe Portable Document Format
Bloque de licencias
Mostrando 1 - 1 de 1
No hay miniatura disponible
Nombre:
license.txt
Tamaño:
3.62 KB
Formato:
Item-specific license agreed to upon submission
Descripción: