Learnya/ Blog
Studente che scrive un compito d'esame in classe
Alison wood, Wikimedia Commons  · CC BY 3.0

Correggere è una delle attività più dispendiose in termini di tempo nell'insegnamento. L'idea di applicarvi gli LLM è allettante: valutazione di risposte brevi, valutazione di saggi, o addirittura un «LLM-giudice» incaricato di arbitrare la qualità di un elaborato. I risparmi di tempo sono reali. Ma la ricerca 2025 invita a distinguere con attenzione ciò che l'IA fa bene da ciò che fa male.

Dove funziona: le risposte brevi

Su risposte brevi e ben delimitate, i modelli migliori raggiungono correlazioni elevate con i correttori umani — fino a valori molto alti in alcuni studi [1]. La valutazione a formato vincolato (definizioni, calcoli, item fattuali) è il terreno più favorevole. Ma non appena la risposta diventa aperta, tecnica o lunga, la variabilità aumenta nettamente [1].

Dove si complica: saggi e giudizio

Per i saggi, il quadro è più fosco. Uno studio condotto su cinque LLM e su elaborati universitari rileva un accordo uomo-macchina debole e una scarsa affidabilità interna, con i modelli che gonfiano in particolare i punteggi di coerenza [2]. La combinazione uomo + IA migliora l'affidabilità rispetto alla sola IA, il che depone a favore di modelli ibridi piuttosto che di un'automazione totale [3].

Il punto cieco dell'equità

Il rischio più preoccupante è quello dell'equità. Alcuni studi mostrano che i punteggi automatizzati divergono da quelli umani in particolare per gli studenti di seconda lingua [6]. Una correzione implementata senza un audit dei bias può quindi penalizzare sistematicamente alcuni gruppi, dando al tempo stesso l'apparenza dell'obiettività algoritmica.

  • Adatto per: risposte brevi, feedback formativi rapidi, preselezione.
  • Da inquadrare: saggi, valutazione sommativa, decisioni ad alta posta in gioco.
  • Da sottoporre sistematicamente ad audit: bias linguistici, culturali e di formato.

Un voto automatizzato è affidabile solo se se ne conoscono gli errori. L'IA di correzione deve potenziare il giudizio dell'insegnante, non confiscarlo.

Sintesi Learnya

Il consenso emergente è chiaro: l'IA eccelle nel generare un feedback formativo rapido e nel ridurre il carico di lavoro, ma la valutazione ad alta posta in gioco deve restare sotto il controllo umano. È anche un requisito normativo: nell'Unione europea, la valutazione dei risultati di apprendimento rientra tra gli usi ad alto rischio disciplinati dall'AI Act. Automatizzare, sì; abdicare al giudizio, no.

Prima il formativo, il sommativo con prudenza

La distinzione più utile per implementare una correzione tramite IA contrappone la valutazione formativa a quella sommativa. Nel formativo — per aiutare lo studente a progredire — un feedback rapido, anche se imperfetto, ha valore: arriva al momento giusto e può essere discusso. Nel sommativo — quando il voto conta e incide sul futuro — il minimo errore o il minimo bias diventa inaccettabile. È proprio qui che la ricerca raccomanda di tenere l'umano al comando [5].

Bisogna anche capire perché i modelli sbagliano. Un LLM non «comprende» un elaborato come un correttore: stima una probabilità a partire da regolarità testuali. Da qui alcuni artefatti documentati — sovrastima della coerenza, sensibilità all'ordine dei criteri, alla lunghezza o allo stile [4]. Questi bias non sono casuali; possono favorire una forma di scrittura a scapito di un'altra, il che pone un problema di equità quando le popolazioni differiscono.

In pratica, una correzione assistita responsabile calibra il modello su elaborati già valutati da esseri umani, misura esplicitamente l'accordo e l'equità tra i gruppi e riserva all'insegnante la convalida finale delle decisioni ad alta posta in gioco. La combinazione uomo + IA, più affidabile della sola IA [3], non è un compromesso timido: è l'architettura che coglie i risparmi di tempo senza rinunciare alla responsabilità pedagogica e giuridica.

La valutazione da ripensare, non solo da automatizzare

L'arrivo dell'IA non dovrebbe soltanto accelerare la correzione esistente; invita a ripensare ciò che si valuta. Se un modello scrive un saggio corretto in pochi secondi, la questione non è più soltanto correggere il saggio, ma stabilire quali competenze si vogliono realmente certificare — ragionare, argomentare, creare, collaborare — e come osservarle in modo affidabile.

I formati emergenti — prove orali, discussioni, valutazione del processo, portfolio — sono al tempo stesso più resistenti all'IA e più allineati agli apprendimenti profondi. Qui l'IA trova pienamente il suo posto come supporto del correttore: preparare, strutturare, segnalare, proporre un primo feedback. La rotta è chiara: automatizzare ciò che può esserlo senza rischi, riservare il giudizio umano alle decisioni che incidono sul futuro degli studenti e misurare senza sosta l'equità del dispositivo.

Fonti

  1. 1. LLM-as-a-Grader: Practical Insights from Large Language Model for Short-Answer and Report Evaluation , Byun, G., Rajwal, S., & Choi, J. D. , arXiv , 2025 https://arxiv.org/abs/2511.10819
  2. 2. Assessing the Reliability and Validity of Large Language Models for Automated Assessment of Student Essays in Higher Education , Gaggioli, A., Casaburi, F., Ercolani, G., Collova, F., Torre, F., & Davide, F. , arXiv , 2025 https://arxiv.org/abs/2508.02442
  3. 3. Exploring LLM Autoscoring Reliability in Large-Scale Writing Assessments Using Generalizability Theory , Song, D., Lee, W.-C., & Jiao, H. , arXiv , 2025 https://arxiv.org/abs/2507.19980
  4. 4. Evaluating Scoring Bias in LLM-as-a-Judge , Li, Q., Dou, S., Shao, K., Chen, C., & Hu, H. , arXiv , 2025 https://arxiv.org/abs/2506.22316
  5. 5. Evaluating large language models as graders of medical short answer questions: a comparative analysis with expert human graders , Bolgova, O., Ganguly, P., Ikram, M., & Mavrych, V. , Medical Education Online , 2025 https://pmc.ncbi.nlm.nih.gov/articles/PMC12377152/
  6. 6. Evaluating LLM-Based Automated Essay Scoring: Accuracy, Fairness, and Validity , Huang, Y., & Wilson, J. , ACL Anthology (AIME-Con) , 2025 https://aclanthology.org/2025.aimecon-wip.9/
  7. 7. LLM-based Automated Grading with Human-in-the-Loop (GradeHITL) , Chu, H., Li, Y., Yang, T., Copur-Gencturk, Y., & Tang, J. , arXiv / IEEE TALE 2025 , 2025 https://arxiv.org/abs/2504.05239
← Tutti gli articoli