Publicación: MentorEval: the largest benchmark for automated student grading
| dc.contributor.author | Gil, Álvaro Francisco | |
| dc.contributor.director | Fresno Fernández, Víctor Diego | |
| dc.date.accessioned | 2026-02-03T12:29:32Z | |
| dc.date.available | 2026-02-03T12:29:32Z | |
| dc.date.issued | 2025-09-21 | |
| dc.description.abstract | Los modelos de lenguaje de gran tamaño se utilizan cada vez más para la evaluación educativa, y estudios recientes destacan su capacidad para aproximarse a la calificación humana [1, 2, 3, 4, 5, 6]. Sin embargo, la mayoría de estos trabajos se basan en conjuntos de datos privados o muy específicos, y actualmente no existe un benchmark multilingüe que permita una evaluación sistemática y transparente a través de distintas tareas e idiomas [7]. Para abordar esta limitación, presentamos MentorEval, la colección más amplia existente de datasets con respuestas de alumnos y correcciones. Concebida como un proyecto en crecimiento, MentorEval integra seis conjuntos de datos públicos en inglés, portugués y árabe, estandarizados bajo un esquema común y disponibles en Hugging Face. Basándose en LightEval, define 203 tareas detalladas y permite la experimentación modular con prompts, modelos y métricas de evaluación. Los resultados se publican automáticamente en una página web de acceso abierto, garantizando reproducibilidad y fomentando contribuciones colaborativas. Para demostrar su utilidad, evaluamos gpt-4o-mini bajo distintas condiciones de prompting. Los experimentos muestran que la inclusión de rúbricas, ejemplos, respuestas ideales y razonamiento explicativo en los prompts mejora de manera consistente el rendimiento. | es |
| dc.description.abstract | Large language models (LLMs) are increasingly applied to educational assessment, with recent studies highlighting their potential to approximate human grading [1, 2, 3, 4, 5, 6]. However, existing work relies on private or highly specific datasets, and no multilingual benchmark currently enables systematic, transparent evaluation across tasks and languages [7]. We address this gap with MentorEval, the largest unified collection of student assessment datasets to date, conceived as a growing project that will continuously incorporate new datasets. MentorEval aggregates six public datasets in English, Portuguese, and Arabic, harmonized under a shared schema and available on Hugging Face. Building on LightEval, it defines 203 fine-grained tasks and supports modular experimentation with prompts, models, and evaluation metrics. Results are automatically displayed on an open-access webpage, ensuring reproducibility and fostering collaborative contributions. To demonstrate its utility, we benchmarked gpt-4o-mini under different prompting conditions. The experiments show that augmenting prompts with rubrics, examples, ideal answers, and explanatory reasoning consistently improves performance. | en |
| dc.description.provenance | Made available in DSpace on 2026-02-03T12:29:32Z (GMT). No. of bitstreams: 1 TFM. MentorEval the largest benchmark for automated student grading. Álvaro Francisco Gil.pdf: 1152367 bytes, checksum: 45d75364a2850eb2e5091b9820acb6ca (MD5) Previous issue date: 2025-09-21 | en |
| dc.identifier.citation | Gil, Álvaro Francisco. Trabajo de Fin de Máster: «MentorEval: the largest benchmark for automated student grading». Universidad Nacional de Educación a Distancia (UNED), 2025 | |
| dc.identifier.uri | https://hdl.handle.net/20.500.14468/31689 | |
| dc.language.iso | en | |
| dc.relation.center | E.T.S. de Ingeniería Informática | |
| dc.relation.degree | Máster Universitario en Tecnologías del Lenguaje | |
| dc.relation.department | Lenguajes y Sistemas Informáticos | |
| dc.rights | info:eu-repo/semantics/openAccess | |
| dc.rights.uri | http://creativecommons.org/licenses/by-nc-nd/4.0/deed.es | |
| dc.subject | 3304 Tecnología de los ordenadores | |
| dc.subject.keywords | Evaluación automática de exámenes | es |
| dc.subject.keywords | LLMs | es |
| dc.subject.keywords | Benchmark multilingüe | es |
| dc.subject.keywords | Student assessment | en |
| dc.subject.keywords | LLM evaluation | en |
| dc.subject.keywords | Multilingual benchmark | en |
| dc.title | MentorEval: the largest benchmark for automated student grading | en |
| dc.type | tesis de maestría | es |
| dc.type | master thesis | en |
| dspace.entity.type | Publication |
Archivos
Bloque original
1 - 1 de 1
Cargando...
- Nombre:
- TFM. MentorEval the largest benchmark for automated student grading. Álvaro Francisco Gil.pdf
- Tamaño:
- 1.1 MB
- Formato:
- Adobe Portable Document Format
Bloque de licencias
1 - 1 de 1
No hay miniatura disponible
- Nombre:
- license.txt
- Tamaño:
- 3.62 KB
- Formato:
- Item-specific license agreed to upon submission
- Descripción: