Para depositar en Docta Complutense, identifícate con tu correo @ucm.es en el SSO institucional. Haz clic en el desplegable de INICIO DE SESIÓN situado en la parte superior derecha de la pantalla. Introduce tu correo electrónico y tu contraseña de la UCM y haz clic en el botón MI CUENTA UCM, no autenticación con contraseña.

Resolución automática de exámenes de comprension lectora en español mediante LLMs

Loading...
Thumbnail Image

Official URL

Full text at PDC

Publication date

2026

Advisors (or tutors)

Editors

Journal Title

Journal ISSN

Volume Title

Publisher

License
Creative Commons
Citations
Google Scholar

Citation

Abstract

La aparición de los grandes modelos de lenguaje (Large Language Models, LLMs) ha transformado el campo del Procesamiento de Lenguaje Natural (PLN) y sus diferentes ramas. Concretamente, la comprensión lectora automática ha experimentado avances muy significativos durante los últimos años. Sin embargo, la mayor parte de los recursos y competiciones existentes se han diseñado principalmente para el inglés, por lo que el español, al igual que otros idiomas, sigue infrarrepresentado dentro de este ámbito. Además, muchos de estos recursos utilizan datos que los modelos pueden haber visto durante su preentrenamiento, lo que dificulta medir su verdadera capacidad de comprensión. Este trabajo aborda ambas limitaciones mediante la participación en la tarea PROFE 2026, enmarcada en IberLEF 2026, cuyo objetivo es evaluar la comprensión lectora automática en español a partir de exámenes oficiales del Instituto Cervantes, bajo las mismas condiciones que se aplican a los candidatos humanos y sin datos de entrenamiento específicos para la tarea. Para ello, se han explorado y comparado distintas soluciones para dos de las subtareas que propone la competición: selección múltiple y emparejamiento de textos. Entre los enfoques probados se encuentran el prompting zero-shot, el razonamiento con chain-of-thought, el fine-tuning sobre corpus externos y los sistemas multi-agente orientados a la resolución colaborativa de este tipo de ejercicios. La mayor ́ıa de las soluciones se han desarrollado sobre modelos de código abierto de tamaño reducido, buscando un equilibrio entre rendimiento competitivo y eficiencia computacional y medioambiental, para lo cual se ha medido el consumo energético y la huella de carbono de cada sistema como criterio de evaluación adicional. Los resultados obtenidos fueron satisfactorios en ambas subtareas. Las arquitecturas multi-agente alcanzaron la mayor precisión, mientras que las estrategias de prompting sobre modelos open source alcanzaron resultados muy competitivos a un coste considerablemente menor. El fine-tuning, en cambio, no mejora al resto de aproximaciones, lo que sugiere que este tipo de tareas, donde los textos son variados y es necesario realizar un razonamiento global sobre ellos, favorece los enfoques que aprovechan las capacidades inherentes de los modelos frente a la adaptación supervisada. En conjunto, estos resultados demuestran que los LLMs actuales, incluso en sus versiones más pequeñas, son capaces de resolver exámenes de comprensión lectora en español a un nivel muy próximo al de los candidatos humanos, y que un prompt bien diseñado puede ser de gran utilidad para aprovechar esa capacidad sin necesidad de adaptación específica ni de soluciones que requieran un alto coste.
The rise of Large Language Models (LLMs) has transformed the field of Natural Language Processing (NLP) and its many subfields. In particular, machine reading comprehension (MRC) has seen significant progress in recent years. However, most existing resources and shared tasks have been designed primarily for English, leaving Spanish, like many other languages, underrepresented in this area. Moreover, many of these resources rely on data that models may have already seen during pretraining, which makes it difficult to properly measure their true comprehension capabilities. This work addresses both limitations by participating in PROFE 2026, a shared task within IberLEF 2026, which evaluates automatic reading comprehension in Spanish using official Instituto Cervantes proficiency exams, under the same conditions applied to human candidates and without any task-specific training data. To this end, different solutions have been explored and compared for two of the sub- tasks proposed by the competition: multiple-choice question answering and text matching. The approaches tested include zero-shot prompting, chain-of-thought reasoning, fine-tuning on external corpora, and multi-agent systems designed for the collaborative resolution of these exercises. Most solutions are built on small open-source models, seek- ing a balance between competitive performance and computational and environmental efficiency, for which the energy consumption and carbon footprint of each system are measured as an additional evaluation criterion. Results are satisfactory on both subtasks. Multi-agent architectures achieve the highest accuracy, while prompting strategies on open-source models reach very competitive results at a considerably lower cost. Fine-tuning, on the other hand, does not improve over the other approaches, suggesting that tasks requiring varied texts and global rea- soning about them favours approaches that take advantage of the capabilities inherent to models rather than supervised adaptation. Overall, these findings show that current LLMs, even in their smaller variants, can solve Spanish reading comprehension exams at a level close to that of human candidates, and that a well-designed prompt can be very useful to take advantage of this capacity without the need for specific adaptation or solutions that require high cost.

Research Projects

Organizational Units

Journal Issue

Description

Para la gestión y el control de versiones del código se utilizó GitHub, lo que permitió mantener un historial completo del desarrollo y facilitar el seguimiento de los cambios a lo largo del proyecto. Todas las soluciones desarrolladas pueden consultarse en el siguiente repositorio. El enlace al repositorio donde se encuentra disponible públicamente todo el código desarrollado a lo largo de este trabajo, incluyendo todas las soluciones implementadas, los conjuntos de datos utilizados para evaluarlas y los resultados obtenidos con cada una de ellas. Repositorio de GitHub: https://github.com/NILGroup/TFM2526-ExamenesComprensionLectora

Keywords