Correggere con l'IA: fino a che punto possiamo fidarci della macchina?
Gli LLM valutano in fretta e a basso costo, ma accordo con l'umano, bias ed equità restano ostacoli seri a una correzione pienamente automatizzata.
Gli LLM valutano in fretta e a basso costo, ma accordo con l'umano, bias ed equità restano ostacoli seri a una correzione pienamente automatizzata.
Correggere è una delle attività più dispendiose in termini di tempo nell'insegnamento. L'idea di applicarvi gli LLM è allettante: valutazione di risposte brevi, valutazione di saggi, o addirittura un «LLM-giudice» incaricato di arbitrare la qualità di un elaborato. I risparmi di tempo sono reali. Ma la ricerca 2025 invita a distinguere con attenzione ciò che l'IA fa bene da ciò che fa male.
Su risposte brevi e ben delimitate, i modelli migliori raggiungono correlazioni elevate con i correttori umani — fino a valori molto alti in alcuni studi [1]. La valutazione a formato vincolato (definizioni, calcoli, item fattuali) è il terreno più favorevole. Ma non appena la risposta diventa aperta, tecnica o lunga, la variabilità aumenta nettamente [1].
Per i saggi, il quadro è più fosco. Uno studio condotto su cinque LLM e su elaborati universitari rileva un accordo uomo-macchina debole e una scarsa affidabilità interna, con i modelli che gonfiano in particolare i punteggi di coerenza [2]. La combinazione uomo + IA migliora l'affidabilità rispetto alla sola IA, il che depone a favore di modelli ibridi piuttosto che di un'automazione totale [3].
Il rischio più preoccupante è quello dell'equità. Alcuni studi mostrano che i punteggi automatizzati divergono da quelli umani in particolare per gli studenti di seconda lingua [6]. Una correzione implementata senza un audit dei bias può quindi penalizzare sistematicamente alcuni gruppi, dando al tempo stesso l'apparenza dell'obiettività algoritmica.
Un voto automatizzato è affidabile solo se se ne conoscono gli errori. L'IA di correzione deve potenziare il giudizio dell'insegnante, non confiscarlo.
Sintesi Learnya
Il consenso emergente è chiaro: l'IA eccelle nel generare un feedback formativo rapido e nel ridurre il carico di lavoro, ma la valutazione ad alta posta in gioco deve restare sotto il controllo umano. È anche un requisito normativo: nell'Unione europea, la valutazione dei risultati di apprendimento rientra tra gli usi ad alto rischio disciplinati dall'AI Act. Automatizzare, sì; abdicare al giudizio, no.
La distinzione più utile per implementare una correzione tramite IA contrappone la valutazione formativa a quella sommativa. Nel formativo — per aiutare lo studente a progredire — un feedback rapido, anche se imperfetto, ha valore: arriva al momento giusto e può essere discusso. Nel sommativo — quando il voto conta e incide sul futuro — il minimo errore o il minimo bias diventa inaccettabile. È proprio qui che la ricerca raccomanda di tenere l'umano al comando [5].
Bisogna anche capire perché i modelli sbagliano. Un LLM non «comprende» un elaborato come un correttore: stima una probabilità a partire da regolarità testuali. Da qui alcuni artefatti documentati — sovrastima della coerenza, sensibilità all'ordine dei criteri, alla lunghezza o allo stile [4]. Questi bias non sono casuali; possono favorire una forma di scrittura a scapito di un'altra, il che pone un problema di equità quando le popolazioni differiscono.
In pratica, una correzione assistita responsabile calibra il modello su elaborati già valutati da esseri umani, misura esplicitamente l'accordo e l'equità tra i gruppi e riserva all'insegnante la convalida finale delle decisioni ad alta posta in gioco. La combinazione uomo + IA, più affidabile della sola IA [3], non è un compromesso timido: è l'architettura che coglie i risparmi di tempo senza rinunciare alla responsabilità pedagogica e giuridica.
L'arrivo dell'IA non dovrebbe soltanto accelerare la correzione esistente; invita a ripensare ciò che si valuta. Se un modello scrive un saggio corretto in pochi secondi, la questione non è più soltanto correggere il saggio, ma stabilire quali competenze si vogliono realmente certificare — ragionare, argomentare, creare, collaborare — e come osservarle in modo affidabile.
I formati emergenti — prove orali, discussioni, valutazione del processo, portfolio — sono al tempo stesso più resistenti all'IA e più allineati agli apprendimenti profondi. Qui l'IA trova pienamente il suo posto come supporto del correttore: preparare, strutturare, segnalare, proporre un primo feedback. La rotta è chiara: automatizzare ciò che può esserlo senza rischi, riservare il giudizio umano alle decisioni che incidono sul futuro degli studenti e misurare senza sosta l'equità del dispositivo.