Cargando...
Miniatura
Fecha
2025-09-21
Derechos de acceso
info:eu-repo/semantics/openAccess
Título de la revista
ISSN de la revista
Título del volumen
Editorial

Citas

plumx
Proyectos de investigación
Unidades organizativas
Número de la revista
Resumen
Los modelos de lenguaje de gran tamaño se utilizan cada vez más para la evaluación educativa, y estudios recientes destacan su capacidad para aproximarse a la calificación humana [1, 2, 3, 4, 5, 6]. Sin embargo, la mayoría de estos trabajos se basan en conjuntos de datos privados o muy específicos, y actualmente no existe un benchmark multilingüe que permita una evaluación sistemática y transparente a través de distintas tareas e idiomas [7]. Para abordar esta limitación, presentamos MentorEval, la colección más amplia existente de datasets con respuestas de alumnos y correcciones. Concebida como un proyecto en crecimiento, MentorEval integra seis conjuntos de datos públicos en inglés, portugués y árabe, estandarizados bajo un esquema común y disponibles en Hugging Face. Basándose en LightEval, define 203 tareas detalladas y permite la experimentación modular con prompts, modelos y métricas de evaluación. Los resultados se publican automáticamente en una página web de acceso abierto, garantizando reproducibilidad y fomentando contribuciones colaborativas. Para demostrar su utilidad, evaluamos gpt-4o-mini bajo distintas condiciones de prompting. Los experimentos muestran que la inclusión de rúbricas, ejemplos, respuestas ideales y razonamiento explicativo en los prompts mejora de manera consistente el rendimiento.
Large language models (LLMs) are increasingly applied to educational assessment, with recent studies highlighting their potential to approximate human grading [1, 2, 3, 4, 5, 6]. However, existing work relies on private or highly specific datasets, and no multilingual benchmark currently enables systematic, transparent evaluation across tasks and languages [7]. We address this gap with MentorEval, the largest unified collection of student assessment datasets to date, conceived as a growing project that will continuously incorporate new datasets. MentorEval aggregates six public datasets in English, Portuguese, and Arabic, harmonized under a shared schema and available on Hugging Face. Building on LightEval, it defines 203 fine-grained tasks and supports modular experimentation with prompts, models, and evaluation metrics. Results are automatically displayed on an open-access webpage, ensuring reproducibility and fostering collaborative contributions. To demonstrate its utility, we benchmarked gpt-4o-mini under different prompting conditions. The experiments show that augmenting prompts with rubrics, examples, ideal answers, and explanatory reasoning consistently improves performance.
Descripción
Categorías UNESCO
Palabras clave
Evaluación automática de exámenes, LLMs, Benchmark multilingüe, Student assessment, LLM evaluation, Multilingual benchmark
Citación
Gil, Álvaro Francisco. Trabajo de Fin de Máster: «MentorEval: the largest benchmark for automated student grading». Universidad Nacional de Educación a Distancia (UNED), 2025
Centro
E.T.S. de Ingeniería Informática
Departamento
Lenguajes y Sistemas Informáticos
Grupo de investigación
Grupo de innovación
Programa de doctorado
Cátedra
Datos de investigación relacionados
DOI