Voz, imagen, texto: la IA multimodal entra en el aula
Tutores que ven un esquema, escuchan una lectura en voz alta y leen un cuaderno: en qué punto está realmente la IA multimodal en educación.
Tutores que ven un esquema, escuchan una lectura en voz alta y leen un cuaderno: en qué punto está realmente la IA multimodal en educación.
Hasta 2023, la IA educativa hablaba sobre todo en texto. La llegada de modelos multimodales —capaces de procesar de forma conjunta texto, imagen, audio y a veces vídeo— cambia la naturaleza de las interacciones posibles. Un estudiante puede fotografiar un ejercicio de geometría escrito a mano, leer un pasaje en voz alta para trabajar su pronunciación o mostrar un esquema de biología y pedir una explicación. Las revisiones recientes sobre los LLM en educación señalan este giro multimodal como uno de los ejes principales para los años 2025-2027 [1].
Estas capacidades se apoyan en modelos recientes que gestionan el habla de entrada y de salida de forma casi nativa, abriendo la vía a tutores conversacionales creíbles. En el terreno de la investigación, la analítica multimodal del aprendizaje (multimodal learning analytics) explota ya sensores, voz y datos de actividad para comprender con precisión procesos hasta ahora invisibles, como la colaboración o la implicación [2].
El entusiasmo debe moderarse. Los modelos multimodales a menudo se evalúan por su capacidad de resolver un problema científico, no de enseñarlo. Un estudio reciente muestra que un modelo excelente en la resolución puede ser un tutor mediocre: da la respuesta en lugar de guiar, o explica mal una figura [3]. La competencia pedagógica —plantear la pregunta adecuada, diagnosticar el error, dosificar la pista— no está correlacionada con el rendimiento bruto.
Los propios docentes formulan expectativas precisas y reservas. Una encuesta a educadores de primaria y secundaria muestra un interés fuerte por los usos multimodales (corrección de producciones manuscritas, retroalimentación oral), pero también inquietudes sobre la fiabilidad, la carga de verificación y la protección de los datos del alumnado [4].
Voz, rostros, escritos manuscritos, vídeos de aula: los datos multimodales son más sensibles que un texto anónimo. La voz es un dato biométrico; la imagen de un menor está sujeta a una protección reforzada. La UNESCO recuerda que el despliegue de la IA educativa debe subordinarse a la protección de los datos y a una visión centrada en el ser humano [5], y el informe AI Index 2025 subraya la brecha persistente entre la adopción y la regulación [6]. Para las instituciones europeas y suizas, esto aboga por arquitecturas en las que el tratamiento multimodal permanezca bajo control —idealmente soberano— en lugar de delegarse a servicios opacos.
La multimodalidad no solo acerca la IA a la forma en que los humanos se comunican; también acerca los riesgos a la forma en que los humanos son identificables.
Síntesis Learnya
En la práctica, el valor de la IA multimodal en educación dependerá menos de la proeza técnica que de tres condiciones: un diseño pedagógico que priorice la guía sobre la solución, una verificación humana de las salidas sensibles y una gobernanza estricta de los datos personales multimodales.
La multimodalidad cobra todo su sentido cuando se desciende al nivel de las disciplinas. En idiomas, un tutor de voz permite trabajar la pronunciación y la fluidez, con una retroalimentación imposible por escrito. En matemáticas y ciencias, la capacidad de leer un esquema manuscrito o una figura cambia las reglas para la corrección y la explicación. En artes e historia, el análisis de imágenes abre diálogos ricos en torno a obras y documentos.
Pero cada modalidad añade su propia falibilidad. El reconocimiento de voz tropieza con los acentos y el ruido; la lectura de imágenes confunde símbolos parecidos o alucina un detalle. Y estos errores son tanto más engañosos cuanto que se acompañan de una respuesta rotunda [3]. En educación, donde el estudiante confía, un error multimodal no señalado puede arraigar de forma duradera. La verificación humana de las salidas sensibles sigue siendo, por tanto, indispensable.
Por último, la cuestión de los datos se plantea con una agudeza particular. Tratar la voz, el rostro o la escritura de un menor entra en categorías sensibles, a menudo biométricas. Los marcos de referencia —con la UNESCO a la cabeza [5]— subordinan el despliegue a la protección de los datos y a una finalidad pedagógica clara. Las arquitecturas que mantienen el tratamiento multimodal cerca del centro, bajo control, ofrecen el mejor equilibrio entre riqueza de uso y confianza.
La multimodalidad acerca la IA a la manera en que de verdad se enseña y se aprende: mediante la palabra, el gesto, la imagen, la manipulación. Es un progreso real para la accesibilidad y para anclar los aprendizajes en lo concreto. Pero cuanto más percibe la IA, más sabe sobre el estudiante, y mayor es la responsabilidad de quien la despliega.
El horizonte 2026-2027 verá sin duda multiplicarse los tutores de voz y los asistentes capaces de leer un cuaderno. La línea que separa los usos responsables de los usos arriesgados pasará por la gobernanza: qué datos multimodales se captan, dónde se tratan, cuánto tiempo se conservan y quién accede a ellos. La riqueza de las modalidades solo tiene valor si se acompaña de un rigor equivalente en la protección de las personas.