Tutores de IA: el viejo sueño del preceptor, ¿de verdad al alcance?
Diversos ensayos controlados muestran que unos tutores de IA bien diseñados rivalizan con la enseñanza activa, pero la distancia entre el prototipo de investigación y el producto sigue siendo amplia.
Por Redacción Learnya8 min de lectura
Jiuguang Wang, Wikimedia Commons · CC BY-SA 3.0
En 1984, Benjamin Bloom formulaba un reto que se hizo célebre: un alumno atendido en tutoría individual con pedagogía del dominio progresaba alrededor de dos desviaciones estándar más que en una clase ordinaria, el «problema de las dos sigmas» [1]. La tutoría humana funcionaba, pero seguía siendo económicamente imposible de generalizar. Cuarenta años después, los grandes modelos de lenguaje reavivan esa promesa: un preceptor paciente y disponible para cada estudiante. Las pruebas empiezan a llegar, y son más matizadas que las demostraciones de marketing.
Ensayos controlados alentadores
En 2025, un ensayo aleatorizado realizado en Harvard comparó un tutor de IA diseñado según principios pedagógicos con una clase de aprendizaje activo: los estudiantes con el tutor de IA aprendieron más, en menos tiempo, y se declararon más implicados [2]. Otro ensayo, en aulas de secundaria del Reino Unido, mostró que los alumnos guiados por un sistema basado en LearnLM lo hacían al menos tan bien como los atendidos por un tutor humano, y resolvían un poco mejor problemas nuevos [3].
La IA también puede potenciar al tutor humano en lugar de sustituirlo. En el ensayo Tutor CoPilot, un copiloto de IA que soplaba sugerencias en tiempo real a los tutores elevó la tasa de dominio de los alumnos en 4 puntos de media, y en 9 puntos para los alumnos atendidos por los tutores peor valorados, por unos 20 dólares por tutor y año [4].
Pero la prudencia sigue siendo necesaria
No todos los estudios concluyen que haya un efecto positivo. Una evaluación de Khanmigo para el aprendizaje de conceptos científicos no encontró ninguna diferencia estadísticamente significativa con una simple búsqueda en Google, aunque los estudiantes percibían la herramienta de forma positiva [5]. Sobre todo, la competencia pedagógica de los modelos sigue siendo desigual: en una tarea compartida de evaluación, los mejores tutores de IA solo alcanzaban puntuaciones modestas a la hora de identificar y corregir de forma fiable los errores de los alumnos [6].
Alucinar una explicación falsa con aplomo sigue siendo posible.
Diagnosticar el origen real de un error es más difícil que dar la respuesta correcta.
Muchos estudios son breves y miden el rendimiento inmediato, no la retención duradera.
El dato que faltaba: los registros de tutorías reales
Una vía prometedora consiste en especializar los modelos a partir de sesiones de tutoría reales. El proyecto TeachLM, entrenado con miles de horas de tutoría individual auténtica, duplicó el tiempo de habla del estudiante y aumentó el número de intercambios, con un estilo de preguntas más cercano al de un buen docente [7]. Dicho de otro modo, un buen tutor de IA no habla más: hace que el alumno hable y piense más.
El objetivo no es un modelo que responde bien, sino un modelo que hace aprender: dos competencias distintas.
Síntesis Learnya
Para las instituciones —en particular en Europa y en Suiza, atentas a la privacidad— el reto va más allá del rendimiento: un tutor de IA maneja datos de aprendizaje sensibles y debe inscribirse en una gobernanza controlada. El sueño de Bloom se vuelve técnicamente creíble, pero se jugará en los detalles de diseño, de prueba y de confianza, no en la sola potencia del modelo.
Del prototipo de investigación al producto sobre el terreno
Un punto merece subrayarse: la mayoría de los resultados alentadores proceden de sistemas cuidadosamente diseñados por equipos de investigación, probados en condiciones controladas. El paso a un producto desplegado en cientos de aulas, con docentes no especialistas, conexiones inestables y programas variados, sigue siendo un salto considerable. Un tutor que brilla en el laboratorio puede decepcionar en condiciones reales si no se han pensado su integración en la clase, su robustez y su mantenimiento.
La calidad misma de las pruebas exige matices. Las tareas compartidas de evaluación muestran que los modelos todavía tienen dificultades para diagnosticar con finura un error o elegir la pista adecuada [6]. Muchos estudios se centran en una sola materia, en un plazo corto, y miden ganancias inmediatas. Faltan aún seguimientos longitudinales que verifiquen la retención varios meses después, o el efecto sobre la motivación y la autonomía a largo plazo.
Por último, un tutor de IA nunca existe solo: se inserta en una ecología de aula. Los mejores resultados combinan la IA y el docente, como muestra el ensayo en el que el sistema apoya sobre todo a los tutores menos experimentados. La buena pregunta no es, pues, «¿lo hace la IA tan bien como un humano?», sino «¿qué reparto de roles maximiza el aprendizaje?». Es una decisión de diseño pedagógico y de organización, no solo de modelo.
Lo que sabremos mejor de aquí a 2027
El campo entra en una fase de madurez en la que las preguntas cambian de naturaleza. Ya no se pregunta solo si un tutor de IA puede hacer progresar a un alumno, sino en qué condiciones, para qué perfiles y a qué coste pedagógico real. Los próximos ensayos deberán comparar no la IA frente a nada, sino distintos diseños de tutores entre sí, y seguir los efectos a lo largo de varios meses.
Tres frentes dominarán: la robustez en condiciones reales, lejos de los laboratorios; la articulación con el trabajo del docente, que sigue siendo el orquestador del sentido; y el control de los datos de aprendizaje, condición de la confianza de las familias. El tutor ideal no será el más locuaz, sino el que sabe cuándo callar para dejar que el alumno indague, y el que rinde cuentas de lo que hace con sus datos.
2.AI tutoring outperforms in-class active learning: an RCT in an authentic educational setting , Kestin, G., Miller, K., Klales, A., et al. , Scientific Reports (Nature) , 2025 — https://www.nature.com/articles/s41598-025-97652-6
3.AI tutoring can safely and effectively support students: an exploratory RCT in UK classrooms , LearnLM Team (Google) & Eedi , arXiv , 2025 — https://arxiv.org/abs/2512.23633
4.Tutor CoPilot: A Human-AI Approach for Scaling Real-Time Expertise , Wang, R. E., Ribeiro, A. T., Robinson, C. D., Loeb, S., & Demszky, D. , arXiv (Stanford) , 2024 — https://arxiv.org/abs/2410.03017
5.Leveraging Khanmigo Generative AI-Powered Tool for Personalized Tutoring to Learn Scientific Concepts , Slijepcevic, N., & Yaylali, A. , Journal of Teaching and Learning (ERIC) , 2025 — https://eric.ed.gov/?id=EJ1487444
6.Findings of the BEA 2025 Shared Task on Pedagogical Ability Assessment of AI-powered Tutors , Kochmar, E., Maurya, K. K., Petukhova, K., Srivatsa, K. V. A., Tack, A., & Vasselli, J. , arXiv (BEA 2025 Workshop) , 2025 — https://arxiv.org/abs/2507.10579
7.TeachLM: Post-Training LLMs for Education Using Authentic Learning Data , Perczel, J., Chow, J., & Demszky, D. , arXiv , 2025 — https://arxiv.org/abs/2510.05087