Voix, image, texte : l'IA multimodale entre dans la salle de classe
Des tuteurs qui voient un schéma, écoutent une lecture à voix haute et lisent un cahier : où en est réellement l'IA multimodale en éducation.
Des tuteurs qui voient un schéma, écoutent une lecture à voix haute et lisent un cahier : où en est réellement l'IA multimodale en éducation.
Jusqu'en 2023, l'IA éducative parlait surtout texte. L'arrivée de modèles multimodaux — capables de traiter conjointement texte, image, audio et parfois vidéo — change la nature des interactions possibles. Un apprenant peut photographier un exercice de géométrie manuscrit, lire un passage à voix haute pour travailler sa prononciation, ou montrer un schéma de biologie et demander une explication. Les revues récentes sur les LLM en éducation identifient cette bascule multimodale comme l'un des axes majeurs pour les années 2025-2027 [1].
Ces capacités s'appuient sur des modèles récents qui gèrent la parole en entrée et en sortie de façon quasi native, ouvrant la voie à des tuteurs conversationnels crédibles. Côté recherche, l'analyse multimodale de l'apprentissage (multimodal learning analytics) exploite désormais capteurs, voix et traces pour comprendre finement des processus jusque-là invisibles, comme la collaboration ou l'engagement [2].
L'enthousiasme doit être tempéré. Les modèles multimodaux sont souvent évalués sur leur capacité à résoudre un problème scientifique, pas à l'enseigner. Une étude récente montre qu'un modèle excellent en résolution peut être un piètre tuteur : il donne la réponse au lieu de guider, ou explique mal une figure [3]. La compétence pédagogique — poser la bonne question, diagnostiquer l'erreur, doser l'indice — n'est pas corrélée à la performance brute.
Les enseignants eux-mêmes formulent des attentes précises et des réserves. Une enquête auprès d'éducateurs du primaire et du secondaire montre un intérêt fort pour les usages multimodaux (correction de productions manuscrites, feedback oral) mais des inquiétudes sur la fiabilité, la charge de vérification et la protection des données des élèves [4].
Voix, visages, écrits manuscrits, vidéos de classe : les données multimodales sont plus sensibles que du texte anonyme. La voix est une donnée biométrique ; l'image d'un mineur relève d'une protection renforcée. L'UNESCO rappelle que le déploiement de l'IA éducative doit être subordonné à la protection des données et à une vision centrée sur l'humain [5], et le rapport AI Index 2025 souligne l'écart persistant entre l'adoption et l'encadrement [6]. Pour les établissements européens et suisses, cela plaide pour des architectures où le traitement multimodal reste sous contrôle — idéalement souverain — plutôt que délégué à des services opaques.
La multimodalité ne rapproche pas seulement l'IA de la façon dont les humains communiquent ; elle rapproche aussi les risques de la façon dont les humains sont identifiables.
Synthèse Learnya
En pratique, la valeur de l'IA multimodale en éducation dépendra moins de la prouesse technique que de trois conditions : une conception pédagogique qui privilégie le guidage sur la solution, une vérification humaine des sorties sensibles, et une gouvernance stricte des données personnelles multimodales.
La multimodalité prend tout son sens quand on descend au niveau des disciplines. En langues, un tuteur vocal permet de travailler la prononciation et la fluidité, avec une rétroaction impossible à l'écrit. En mathématiques et en sciences, la capacité à lire un schéma manuscrit ou une figure change la donne pour la correction et l'explication. En arts et en histoire, l'analyse d'images ouvre des dialogues nourris autour d'œuvres et de documents.
Mais chaque modalité ajoute sa propre faillibilité. La reconnaissance vocale bute sur les accents et le bruit ; la lecture d'images confond des symboles proches ou hallucine un détail. Or ces erreurs sont d'autant plus trompeuses qu'elles s'accompagnent d'une réponse assurée [3]. En éducation, où l'apprenant fait confiance, une erreur multimodale non signalée peut s'ancrer durablement. La vérification humaine des sorties sensibles reste donc indispensable.
Enfin, la question des données se pose avec une acuité particulière. Traiter la voix, le visage ou l'écriture d'un mineur relève de catégories sensibles, souvent biométriques. Les cadres de référence — l'UNESCO en tête [5] — subordonnent le déploiement à la protection des données et à une finalité pédagogique claire. Les architectures qui gardent le traitement multimodal proche de l'établissement, sous contrôle, offrent le meilleur compromis entre richesse d'usage et confiance.
La multimodalité rapproche l'IA de la manière dont on enseigne et on apprend vraiment : par la parole, le geste, l'image, la manipulation. C'est un progrès réel pour l'accessibilité et pour l'ancrage des apprentissages dans le concret. Mais plus l'IA perçoit, plus elle en sait sur l'apprenant — et plus la responsabilité de celui qui déploie est grande.
L'horizon 2026-2027 verra sans doute se multiplier les tuteurs vocaux et les assistants capables de lire un cahier. La ligne de partage entre usages responsables et usages risqués passera par la gouvernance : quelles données multimodales sont captées, où elles sont traitées, combien de temps elles sont conservées, et qui y accède. La richesse des modalités n'a de valeur que si elle s'accompagne d'une rigueur équivalente sur la protection des personnes.