Learnya/ Blog

Voce, immagine, testo: l'IA multimodale entra in aula

Tutor che vedono uno schema, ascoltano una lettura ad alta voce e leggono un quaderno: a che punto è davvero l'IA multimodale nell'istruzione.

Studente al lavoro davanti a un computer portatile
Courtcourtwest, Wikimedia Commons  · CC BY-SA 4.0

Fino al 2023, l'IA educativa parlava soprattutto il linguaggio del testo. L'arrivo di modelli multimodali, capaci di elaborare congiuntamente testo, immagine, audio e talvolta video, cambia la natura delle interazioni possibili. Chi apprende può fotografare un esercizio di geometria scritto a mano, leggere un passaggio ad alta voce per esercitare la pronuncia, oppure mostrare uno schema di biologia e chiedere una spiegazione. Le rassegne recenti sugli LLM nell'istruzione individuano questo passaggio al multimodale come uno degli assi principali per gli anni 2025-2027 [1].

Ciò che la multimodalità rende possibile

  • Comprendere un lavoro scritto a mano o uno schema fotografato, non solo del testo digitato.
  • Tutor vocali: dialogo parlato, esercizio della lettura, delle lingue, dell'orale.
  • Analisi multimodale dell'apprendimento: gesti, prosodia, collaborazione in classe.
  • Accessibilità: descrizione di immagini per gli studenti ipovedenti, sottotitolazione, sintesi vocale.

Queste capacità si basano su modelli recenti che gestiscono il parlato in ingresso e in uscita in modo quasi nativo, aprendo la strada a tutor conversazionali credibili. Sul fronte della ricerca, l'analisi multimodale dell'apprendimento (multimodal learning analytics) sfrutta ormai sensori, voce e tracce per comprendere in dettaglio processi finora invisibili, come la collaborazione o il coinvolgimento [2].

Un tranello: saper risolvere non è saper insegnare

L'entusiasmo va temperato. I modelli multimodali sono spesso valutati sulla loro capacità di risolvere un problema scientifico, non di insegnarlo. Uno studio recente mostra che un modello eccellente nella risoluzione può essere un pessimo tutor: fornisce la risposta invece di guidare, o spiega male una figura [3]. La competenza pedagogica, porre la domanda giusta, diagnosticare l'errore, dosare l'indizio, non è correlata alla performance grezza.

Gli stessi insegnanti esprimono aspettative precise e riserve. Un'indagine su educatori della scuola primaria e secondaria mostra un forte interesse per gli usi multimodali (correzione di elaborati scritti a mano, feedback orale) ma preoccupazioni sull'affidabilità, sul carico di verifica e sulla protezione dei dati degli studenti [4].

Riservatezza: la multimodalità alza la posta

Voce, volti, testi manoscritti, video delle lezioni: i dati multimodali sono più sensibili di un testo anonimo. La voce è un dato biometrico; l'immagine di un minore rientra in una protezione rafforzata. L'UNESCO ricorda che l'introduzione dell'IA educativa deve essere subordinata alla protezione dei dati e a una visione centrata sull'essere umano [5], e il rapporto AI Index 2025 sottolinea il divario persistente tra l'adozione e la regolamentazione [6]. Per gli istituti europei e svizzeri, ciò depone a favore di architetture in cui il trattamento multimodale resti sotto controllo, idealmente sovrano, anziché delegato a servizi opachi.

La multimodalità non avvicina soltanto l'IA al modo in cui gli esseri umani comunicano; avvicina anche i rischi al modo in cui gli esseri umani sono identificabili.

Sintesi Learnya

In pratica, il valore dell'IA multimodale nell'istruzione dipenderà meno dalla prodezza tecnica che da tre condizioni: una progettazione didattica che privilegi la guida rispetto alla soluzione, una verifica umana degli output sensibili e una governance rigorosa dei dati personali multimodali.

Casi d'uso concreti, disciplina per disciplina

La multimodalità acquista pieno senso quando si scende al livello delle discipline. Nelle lingue, un tutor vocale permette di lavorare sulla pronuncia e sulla scioltezza, con un riscontro impossibile allo scritto. In matematica e nelle scienze, la capacità di leggere uno schema scritto a mano o una figura cambia le carte in tavola per la correzione e la spiegazione. Nelle arti e nella storia, l'analisi delle immagini apre dialoghi ricchi attorno a opere e documenti.

Ma ogni modalità aggiunge la propria fallibilità. Il riconoscimento vocale inciampa sugli accenti e sul rumore; la lettura delle immagini confonde simboli simili o allucina un dettaglio. E questi errori sono tanto più ingannevoli in quanto si accompagnano a una risposta sicura [3]. Nell'istruzione, dove chi apprende si fida, un errore multimodale non segnalato può radicarsi a lungo. La verifica umana degli output sensibili resta quindi indispensabile.

Infine, la questione dei dati si pone con particolare acutezza. Trattare la voce, il volto o la scrittura di un minore rientra in categorie sensibili, spesso biometriche. I quadri di riferimento, con l'UNESCO in testa [5], subordinano l'introduzione alla protezione dei dati e a una chiara finalità pedagogica. Le architetture che mantengono il trattamento multimodale vicino all'istituto, sotto controllo, offrono il miglior compromesso tra ricchezza d'uso e fiducia.

Una ricchezza da governare

La multimodalità avvicina l'IA al modo in cui si insegna e si apprende davvero: attraverso la parola, il gesto, l'immagine, la manipolazione. È un progresso reale per l'accessibilità e per l'ancoraggio degli apprendimenti nel concreto. Ma più l'IA percepisce, più sa di chi apprende, e maggiore è la responsabilità di chi la mette in campo.

L'orizzonte 2026-2027 vedrà senza dubbio moltiplicarsi i tutor vocali e gli assistenti capaci di leggere un quaderno. La linea di demarcazione tra usi responsabili e usi rischiosi passerà per la governance: quali dati multimodali vengono raccolti, dove vengono trattati, per quanto tempo vengono conservati e chi vi accede. La ricchezza delle modalità ha valore solo se accompagnata da un rigore equivalente sulla protezione delle persone.

Fonti

  1. 1. Large Language Models for Education: A Survey and Outlook , Wang, S., et al. , arXiv , 2024 https://arxiv.org/abs/2403.18105
  2. 2. Artificial intelligence in multimodal learning analytics: A systematic literature review , Multiple authors , Computers and Education: Artificial Intelligence , 2025 https://www.sciencedirect.com/science/article/pii/S2666920X25000669
  3. 3. Is Your Multimodal Large Language Model a Good Science Tutor? , Multiple authors , arXiv , 2025 https://arxiv.org/abs/2505.06418
  4. 4. Beyond Text: Probing K-12 Educators' Perspectives and Ideas for Learning Opportunities Leveraging Multimodal Large Language Models , Multiple authors , arXiv , 2025 https://arxiv.org/abs/2507.20720
  5. 5. Guidance for generative AI in education and research , UNESCO , UNESCO , 2023 https://www.unesco.org/en/articles/guidance-generative-ai-education-and-research
  6. 6. The 2025 AI Index Report — Education , Stanford Institute for Human-Centered AI (HAI) , Stanford HAI , 2025 https://hai.stanford.edu/ai-index/2025-ai-index-report/education
← Tutti gli articoli