Learnya/ Blog

Corregir con IA: ¿hasta dónde se puede confiar en la máquina?

Los LLM califican rápido y a menor coste, pero la concordancia con el humano, los sesgos y la equidad siguen siendo obstáculos serios para una corrección plenamente automatizada.

Estudiante redactando un examen en clase
Alison wood, Wikimedia Commons  · CC BY 3.0

Corregir es una de las tareas que más tiempo consumen en la enseñanza. La idea de aplicarle los LLM resulta atractiva: calificación de respuestas cortas, evaluación de ensayos e incluso un «LLM-juez» encargado de arbitrar la calidad de una producción. Los ahorros de tiempo son reales. Pero la investigación de 2025 invita a distinguir con cuidado lo que la IA hace bien de lo que hace mal.

Donde funciona: las respuestas cortas

En respuestas cortas y bien delimitadas, los mejores modelos alcanzan correlaciones altas con los correctores humanos, hasta valores muy elevados en algunos estudios [1]. La calificación de formato restringido (definiciones, cálculos, ítems factuales) es el terreno más favorable. Pero en cuanto la respuesta se vuelve abierta, técnica o extensa, la variabilidad aumenta con claridad [1].

Donde se complica: ensayos y juicio

En los ensayos, el panorama es más sombrío. Un estudio sobre cinco LLM y exámenes universitarios halla una concordancia humano-máquina baja y una fiabilidad interna mediocre, con modelos que inflan en particular las puntuaciones de coherencia [2]. La combinación humano + IA mejora la fiabilidad frente a la IA sola, lo que aboga por modelos híbridos antes que por una automatización total [3].

El punto ciego de la equidad

El riesgo más preocupante es el de la equidad. Diversos trabajos muestran que las puntuaciones automatizadas divergen de las humanas, en particular para los estudiantes de segunda lengua [6]. Una corrección desplegada sin auditoría de sesgos puede, por tanto, penalizar sistemáticamente a ciertos grupos, dando al mismo tiempo la apariencia de objetividad algorítmica.

  • Bueno para: respuestas cortas, devoluciones formativas rápidas, preselección.
  • A encuadrar: ensayos, calificación sumativa, decisiones de peso.
  • A auditar sistemáticamente: sesgos lingüísticos, culturales y de formato.

Una nota automatizada solo es fiable si se conocen sus errores. La IA de corrección debe potenciar el criterio del docente, no confiscarlo.

Síntesis Learnya

El consenso emergente es claro: la IA sobresale a la hora de generar una devolución formativa rápida y de reducir la carga, pero la calificación de peso debe permanecer bajo control humano. Es también una exigencia normativa: en la Unión Europea, la evaluación de los resultados de aprendizaje entra en los usos de alto riesgo regulados por el Reglamento de IA (AI Act). Automatizar, sí; abdicar del criterio, no.

Primero formativo, sumativo con prudencia

La distinción más útil para desplegar una corrección por IA enfrenta la evaluación formativa a la sumativa. En lo formativo —para ayudar al alumno a progresar— una devolución rápida, aunque imperfecta, tiene valor: llega en el momento oportuno y puede discutirse. En lo sumativo —cuando la nota cuenta y compromete el futuro— el menor error o el menor sesgo resulta inaceptable. Es precisamente ahí donde la investigación recomienda mantener al ser humano al mando [5].

También hay que entender por qué se equivocan los modelos. Un LLM no «comprende» un examen como un corrector: estima una probabilidad a partir de regularidades textuales. De ahí artefactos documentados: sobrepuntuación de la coherencia, sensibilidad al orden de los criterios, a la extensión o al estilo [4]. Estos sesgos no son aleatorios; pueden favorecer una forma de escritura en detrimento de otra, lo que plantea un problema de equidad cuando las poblaciones difieren.

En la práctica, una corrección asistida responsable calibra el modelo con exámenes ya calificados por humanos, mide de forma explícita la concordancia y la equidad entre grupos, y reserva al docente la validación final de las decisiones de peso. La combinación humano + IA, más fiable que la IA sola [3], no es una solución tibia: es la arquitectura que capta los ahorros de tiempo sin renunciar a la responsabilidad pedagógica y jurídica.

Repensar la evaluación, no solo automatizarla

La llegada de la IA no debería solo acelerar la corrección existente; invita a repensar qué se evalúa. Si un modelo redacta un ensayo correcto en unos segundos, la cuestión ya no es solo corregir el ensayo, sino saber qué competencias se quieren certificar de verdad —razonar, argumentar, crear, colaborar— y cómo observarlas de forma fiable.

Los formatos al alza —orales, defensas, evaluación del proceso, portafolios— son a la vez más resistentes a la IA y más alineados con los aprendizajes profundos. La IA encuentra ahí todo su lugar como apoyo del corrector: preparar, estructurar, señalar, proponer una primera devolución. El rumbo es claro: automatizar lo que puede serlo sin riesgo, reservar el criterio humano para las decisiones que comprometen el futuro de los estudiantes y medir sin descanso la equidad del dispositivo.

Fuentes

  1. 1. LLM-as-a-Grader: Practical Insights from Large Language Model for Short-Answer and Report Evaluation , Byun, G., Rajwal, S., & Choi, J. D. , arXiv , 2025 https://arxiv.org/abs/2511.10819
  2. 2. Assessing the Reliability and Validity of Large Language Models for Automated Assessment of Student Essays in Higher Education , Gaggioli, A., Casaburi, F., Ercolani, G., Collova, F., Torre, F., & Davide, F. , arXiv , 2025 https://arxiv.org/abs/2508.02442
  3. 3. Exploring LLM Autoscoring Reliability in Large-Scale Writing Assessments Using Generalizability Theory , Song, D., Lee, W.-C., & Jiao, H. , arXiv , 2025 https://arxiv.org/abs/2507.19980
  4. 4. Evaluating Scoring Bias in LLM-as-a-Judge , Li, Q., Dou, S., Shao, K., Chen, C., & Hu, H. , arXiv , 2025 https://arxiv.org/abs/2506.22316
  5. 5. Evaluating large language models as graders of medical short answer questions: a comparative analysis with expert human graders , Bolgova, O., Ganguly, P., Ikram, M., & Mavrych, V. , Medical Education Online , 2025 https://pmc.ncbi.nlm.nih.gov/articles/PMC12377152/
  6. 6. Evaluating LLM-Based Automated Essay Scoring: Accuracy, Fairness, and Validity , Huang, Y., & Wilson, J. , ACL Anthology (AIME-Con) , 2025 https://aclanthology.org/2025.aimecon-wip.9/
  7. 7. LLM-based Automated Grading with Human-in-the-Loop (GradeHITL) , Chu, H., Li, Y., Yang, T., Copur-Gencturk, Y., & Tang, J. , arXiv / IEEE TALE 2025 , 2025 https://arxiv.org/abs/2504.05239
← Todos los artículos