Voz, imagem, texto: a IA multimodal entra na sala de aula
Tutores que veem um esquema, escutam uma leitura em voz alta e leem um caderno: em que ponto está realmente a IA multimodal na educação.
Tutores que veem um esquema, escutam uma leitura em voz alta e leem um caderno: em que ponto está realmente a IA multimodal na educação.
Até 2023, a IA educativa falava sobretudo texto. A chegada de modelos multimodais — capazes de processar conjuntamente texto, imagem, áudio e, por vezes, vídeo — muda a natureza das interações possíveis. Um aluno pode fotografar um exercício de geometria manuscrito, ler uma passagem em voz alta para trabalhar a pronúncia ou mostrar um esquema de biologia e pedir uma explicação. As revisões recentes sobre os LLM na educação identificam esta viragem multimodal como um dos eixos principais para os anos 2025-2027 [1].
Estas capacidades assentam em modelos recentes que gerem a fala à entrada e à saída de forma quase nativa, abrindo caminho a tutores conversacionais credíveis. Do lado da investigação, a análise multimodal da aprendizagem (multimodal learning analytics) explora agora sensores, voz e registos para compreender ao pormenor processos até aqui invisíveis, como a colaboração ou o envolvimento [2].
O entusiasmo deve ser moderado. Os modelos multimodais são frequentemente avaliados pela sua capacidade de resolver um problema científico, não de o ensinar. Um estudo recente mostra que um modelo excelente na resolução pode ser um tutor medíocre: dá a resposta em vez de orientar, ou explica mal uma figura [3]. A competência pedagógica — colocar a pergunta certa, diagnosticar o erro, dosear a dica — não está correlacionada com o desempenho bruto.
Os próprios professores formulam expectativas precisas e reservas. Um inquérito a educadores do ensino básico e secundário revela um forte interesse pelas utilizações multimodais (correção de produções manuscritas, feedback oral), mas também preocupações quanto à fiabilidade, à carga de verificação e à proteção dos dados dos alunos [4].
Voz, rostos, escritos manuscritos, vídeos de aula: os dados multimodais são mais sensíveis do que um texto anónimo. A voz é um dado biométrico; a imagem de um menor está sujeita a uma proteção reforçada. A UNESCO recorda que a implementação da IA educativa deve estar subordinada à proteção de dados e a uma visão centrada no ser humano [5], e o relatório AI Index 2025 sublinha o fosso persistente entre a adoção e a regulação [6]. Para os estabelecimentos europeus e suíços, isto milita a favor de arquiteturas em que o processamento multimodal permanece sob controlo — idealmente soberano — em vez de delegado a serviços opacos.
A multimodalidade não aproxima apenas a IA da forma como os humanos comunicam; aproxima também os riscos da forma como os humanos são identificáveis.
Síntese Learnya
Na prática, o valor da IA multimodal na educação dependerá menos da proeza técnica do que de três condições: uma conceção pedagógica que privilegie a orientação em vez da solução, uma verificação humana das saídas sensíveis e uma governação estrita dos dados pessoais multimodais.
A multimodalidade ganha todo o seu sentido quando descemos ao nível das disciplinas. Nas línguas, um tutor vocal permite trabalhar a pronúncia e a fluência, com um retorno impossível por escrito. Na matemática e nas ciências, a capacidade de ler um esquema manuscrito ou uma figura muda tudo na correção e na explicação. Nas artes e na história, a análise de imagens abre diálogos ricos em torno de obras e de documentos.
Mas cada modalidade acrescenta a sua própria falibilidade. O reconhecimento de voz tropeça nos sotaques e no ruído; a leitura de imagens confunde símbolos próximos ou alucina um pormenor. Ora, estes erros são tanto mais enganadores quanto se fazem acompanhar de uma resposta segura de si [3]. Na educação, onde o aluno confia, um erro multimodal não assinalado pode enraizar-se de forma duradoura. A verificação humana das saídas sensíveis permanece, por isso, indispensável.
Por fim, a questão dos dados coloca-se com particular acuidade. Processar a voz, o rosto ou a escrita de um menor insere-se em categorias sensíveis, muitas vezes biométricas. Os quadros de referência — com a UNESCO à cabeça [5] — subordinam a implementação à proteção de dados e a uma finalidade pedagógica clara. As arquiteturas que mantêm o processamento multimodal próximo do estabelecimento, sob controlo, oferecem o melhor compromisso entre riqueza de utilização e confiança.
A multimodalidade aproxima a IA da forma como realmente se ensina e se aprende: pela fala, pelo gesto, pela imagem, pela manipulação. É um progresso real para a acessibilidade e para o enraizamento das aprendizagens no concreto. Mas quanto mais a IA perceciona, mais sabe sobre o aluno — e maior é a responsabilidade de quem a implementa.
O horizonte de 2026-2027 verá certamente multiplicarem-se os tutores vocais e os assistentes capazes de ler um caderno. A linha de separação entre utilizações responsáveis e utilizações arriscadas passará pela governação: que dados multimodais são captados, onde são processados, durante quanto tempo são conservados e quem lhes acede. A riqueza das modalidades só tem valor se for acompanhada de um rigor equivalente na proteção das pessoas.