Learnya/ Blog

Voz, imagem, texto: a IA multimodal entra na sala de aula

Tutores que veem um esquema, escutam uma leitura em voz alta e leem um caderno: em que ponto está realmente a IA multimodal na educação.

Estudante a trabalhar em frente a um computador portátil
Courtcourtwest, Wikimedia Commons  · CC BY-SA 4.0

Até 2023, a IA educativa falava sobretudo texto. A chegada de modelos multimodais — capazes de processar conjuntamente texto, imagem, áudio e, por vezes, vídeo — muda a natureza das interações possíveis. Um aluno pode fotografar um exercício de geometria manuscrito, ler uma passagem em voz alta para trabalhar a pronúncia ou mostrar um esquema de biologia e pedir uma explicação. As revisões recentes sobre os LLM na educação identificam esta viragem multimodal como um dos eixos principais para os anos 2025-2027 [1].

O que a multimodalidade torna possível

  • Compreender um trabalho manuscrito ou um esquema fotografado, não apenas texto digitado.
  • Tutores vocais: diálogo falado, trabalho da leitura, das línguas, da oralidade.
  • Análise multimodal da aprendizagem: gestos, prosódia, colaboração na aula.
  • Acessibilidade: descrição de imagens para os alunos com deficiência visual, legendagem, oralização.

Estas capacidades assentam em modelos recentes que gerem a fala à entrada e à saída de forma quase nativa, abrindo caminho a tutores conversacionais credíveis. Do lado da investigação, a análise multimodal da aprendizagem (multimodal learning analytics) explora agora sensores, voz e registos para compreender ao pormenor processos até aqui invisíveis, como a colaboração ou o envolvimento [2].

Uma armadilha: resolver bem não é ensinar bem

O entusiasmo deve ser moderado. Os modelos multimodais são frequentemente avaliados pela sua capacidade de resolver um problema científico, não de o ensinar. Um estudo recente mostra que um modelo excelente na resolução pode ser um tutor medíocre: dá a resposta em vez de orientar, ou explica mal uma figura [3]. A competência pedagógica — colocar a pergunta certa, diagnosticar o erro, dosear a dica — não está correlacionada com o desempenho bruto.

Os próprios professores formulam expectativas precisas e reservas. Um inquérito a educadores do ensino básico e secundário revela um forte interesse pelas utilizações multimodais (correção de produções manuscritas, feedback oral), mas também preocupações quanto à fiabilidade, à carga de verificação e à proteção dos dados dos alunos [4].

Confidencialidade: a multimodalidade eleva o que está em jogo

Voz, rostos, escritos manuscritos, vídeos de aula: os dados multimodais são mais sensíveis do que um texto anónimo. A voz é um dado biométrico; a imagem de um menor está sujeita a uma proteção reforçada. A UNESCO recorda que a implementação da IA educativa deve estar subordinada à proteção de dados e a uma visão centrada no ser humano [5], e o relatório AI Index 2025 sublinha o fosso persistente entre a adoção e a regulação [6]. Para os estabelecimentos europeus e suíços, isto milita a favor de arquiteturas em que o processamento multimodal permanece sob controlo — idealmente soberano — em vez de delegado a serviços opacos.

A multimodalidade não aproxima apenas a IA da forma como os humanos comunicam; aproxima também os riscos da forma como os humanos são identificáveis.

Síntese Learnya

Na prática, o valor da IA multimodal na educação dependerá menos da proeza técnica do que de três condições: uma conceção pedagógica que privilegie a orientação em vez da solução, uma verificação humana das saídas sensíveis e uma governação estrita dos dados pessoais multimodais.

Casos de uso concretos, disciplina a disciplina

A multimodalidade ganha todo o seu sentido quando descemos ao nível das disciplinas. Nas línguas, um tutor vocal permite trabalhar a pronúncia e a fluência, com um retorno impossível por escrito. Na matemática e nas ciências, a capacidade de ler um esquema manuscrito ou uma figura muda tudo na correção e na explicação. Nas artes e na história, a análise de imagens abre diálogos ricos em torno de obras e de documentos.

Mas cada modalidade acrescenta a sua própria falibilidade. O reconhecimento de voz tropeça nos sotaques e no ruído; a leitura de imagens confunde símbolos próximos ou alucina um pormenor. Ora, estes erros são tanto mais enganadores quanto se fazem acompanhar de uma resposta segura de si [3]. Na educação, onde o aluno confia, um erro multimodal não assinalado pode enraizar-se de forma duradoura. A verificação humana das saídas sensíveis permanece, por isso, indispensável.

Por fim, a questão dos dados coloca-se com particular acuidade. Processar a voz, o rosto ou a escrita de um menor insere-se em categorias sensíveis, muitas vezes biométricas. Os quadros de referência — com a UNESCO à cabeça [5] — subordinam a implementação à proteção de dados e a uma finalidade pedagógica clara. As arquiteturas que mantêm o processamento multimodal próximo do estabelecimento, sob controlo, oferecem o melhor compromisso entre riqueza de utilização e confiança.

Uma riqueza a governar

A multimodalidade aproxima a IA da forma como realmente se ensina e se aprende: pela fala, pelo gesto, pela imagem, pela manipulação. É um progresso real para a acessibilidade e para o enraizamento das aprendizagens no concreto. Mas quanto mais a IA perceciona, mais sabe sobre o aluno — e maior é a responsabilidade de quem a implementa.

O horizonte de 2026-2027 verá certamente multiplicarem-se os tutores vocais e os assistentes capazes de ler um caderno. A linha de separação entre utilizações responsáveis e utilizações arriscadas passará pela governação: que dados multimodais são captados, onde são processados, durante quanto tempo são conservados e quem lhes acede. A riqueza das modalidades só tem valor se for acompanhada de um rigor equivalente na proteção das pessoas.

Fontes

  1. 1. Large Language Models for Education: A Survey and Outlook , Wang, S., et al. , arXiv , 2024 https://arxiv.org/abs/2403.18105
  2. 2. Artificial intelligence in multimodal learning analytics: A systematic literature review , Multiple authors , Computers and Education: Artificial Intelligence , 2025 https://www.sciencedirect.com/science/article/pii/S2666920X25000669
  3. 3. Is Your Multimodal Large Language Model a Good Science Tutor? , Multiple authors , arXiv , 2025 https://arxiv.org/abs/2505.06418
  4. 4. Beyond Text: Probing K-12 Educators' Perspectives and Ideas for Learning Opportunities Leveraging Multimodal Large Language Models , Multiple authors , arXiv , 2025 https://arxiv.org/abs/2507.20720
  5. 5. Guidance for generative AI in education and research , UNESCO , UNESCO , 2023 https://www.unesco.org/en/articles/guidance-generative-ai-education-and-research
  6. 6. The 2025 AI Index Report — Education , Stanford Institute for Human-Centered AI (HAI) , Stanford HAI , 2025 https://hai.stanford.edu/ai-index/2025-ai-index-report/education
← Todos os artigos