Corriger avec l'IA : jusqu'où peut-on faire confiance à la machine ?
Les LLM notent vite et à moindre coût, mais accord avec l'humain, biais et équité restent des obstacles sérieux à une correction pleinement automatisée.
Les LLM notent vite et à moindre coût, mais accord avec l'humain, biais et équité restent des obstacles sérieux à une correction pleinement automatisée.
Corriger est l'une des tâches les plus chronophages de l'enseignement. L'idée d'y appliquer les LLM séduit : notation de réponses courtes, évaluation de dissertations, voire « LLM-juge » chargé d'arbitrer la qualité d'une production. Les gains de temps sont réels. Mais la recherche 2025 invite à distinguer soigneusement ce que l'IA fait bien de ce qu'elle fait mal.
Sur des réponses courtes et bien cadrées, les meilleurs modèles atteignent des corrélations élevées avec les correcteurs humains — jusqu'à des valeurs très fortes dans certaines études [1]. La notation de format contraint (définitions, calculs, items factuels) est le terrain le plus favorable. Mais dès que la réponse devient ouverte, technique ou longue, la variabilité augmente nettement [1].
Pour les dissertations, le tableau est plus sombre. Une étude portant sur cinq LLM et des copies universitaires trouve un accord humain-machine faible et une fiabilité interne médiocre, les modèles gonflant notamment les scores de cohérence [2]. La composition humain + IA améliore la fiabilité par rapport à l'IA seule, ce qui plaide pour des modèles hybrides plutôt que pour une automatisation totale [3].
Le risque le plus préoccupant est celui de l'équité. Des travaux montrent que les scores automatisés divergent des scores humains en particulier pour les apprenants de langue seconde [6]. Une correction déployée sans audit de biais peut donc pénaliser systématiquement certains groupes, tout en donnant l'apparence de l'objectivité algorithmique.
Une note automatisée n'est fiable que si l'on connaît ses erreurs. L'IA de correction doit augmenter le jugement de l'enseignant, pas le confisquer.
Synthèse Learnya
Le consensus émergent est clair : l'IA excelle à générer un retour formatif rapide et à réduire la charge, mais la notation à enjeu doit rester sous contrôle humain. C'est aussi une exigence réglementaire : dans l'Union européenne, l'évaluation des résultats d'apprentissage entre dans les usages à haut risque encadrés par l'AI Act. Automatiser, oui ; abdiquer le jugement, non.
La distinction la plus utile pour déployer une correction par IA oppose l'évaluation formative à l'évaluation sommative. En formatif — pour aider l'élève à progresser — un retour rapide, même imparfait, a de la valeur : il arrive au bon moment et peut être discuté. En sommatif — quand la note compte et engage l'avenir — la moindre erreur ou le moindre biais devient inacceptable. C'est précisément là que la recherche recommande de garder l'humain aux commandes [5].
Il faut aussi comprendre pourquoi les modèles se trompent. Un LLM ne « comprend » pas une copie comme un correcteur : il estime une probabilité à partir de régularités textuelles. D'où des artefacts documentés — surnotation de la cohérence, sensibilité à l'ordre des critères, à la longueur ou au style [4]. Ces biais ne sont pas aléatoires ; ils peuvent avantager une forme d'écriture au détriment d'une autre, ce qui pose un problème d'équité quand les populations diffèrent.
En pratique, une correction assistée responsable calibre le modèle sur des copies déjà notées par des humains, mesure explicitement l'accord et l'équité entre groupes, et réserve à l'enseignant la validation finale des décisions à enjeu. La composition humain + IA, plus fiable que l'IA seule [3], n'est pas un compromis timide : c'est l'architecture qui capte les gains de temps sans abandonner la responsabilité pédagogique et juridique.
L'arrivée de l'IA ne devrait pas seulement accélérer la correction existante ; elle invite à repenser ce que l'on évalue. Si un modèle rédige une dissertation correcte en quelques secondes, la question n'est plus seulement de corriger la dissertation, mais de savoir quelles compétences on veut réellement certifier — raisonner, argumenter, créer, collaborer — et comment les observer de façon fiable.
Les formats montants — oraux, soutenances, évaluation du processus, portfolios — sont à la fois plus résistants à l'IA et plus alignés sur les apprentissages profonds. L'IA y trouve toute sa place comme soutien du correcteur : préparer, structurer, signaler, proposer un premier retour. Le cap est clair : automatiser ce qui peut l'être sans risque, réserver le jugement humain aux décisions qui engagent l'avenir des apprenants, et mesurer sans relâche l'équité du dispositif.