Corrigir com IA: até onde podemos confiar na máquina?
Os LLM classificam depressa e a menor custo, mas a concordância com o humano, o enviesamento e a equidade continuam a ser obstáculos sérios a uma correção totalmente automatizada.
Os LLM classificam depressa e a menor custo, mas a concordância com o humano, o enviesamento e a equidade continuam a ser obstáculos sérios a uma correção totalmente automatizada.
Corrigir é uma das tarefas mais morosas do ensino. A ideia de lhe aplicar os LLM é sedutora: classificação de respostas curtas, avaliação de dissertações, ou até um «LLM-juiz» encarregado de arbitrar a qualidade de uma produção. Os ganhos de tempo são reais. Mas a investigação de 2025 convida a distinguir cuidadosamente aquilo que a IA faz bem daquilo que faz mal.
Em respostas curtas e bem delimitadas, os melhores modelos atingem correlações elevadas com os corretores humanos — chegando a valores muito fortes em alguns estudos [1]. A classificação de formato restrito (definições, cálculos, itens factuais) é o terreno mais favorável. Mas assim que a resposta se torna aberta, técnica ou longa, a variabilidade aumenta nitidamente [1].
No caso das dissertações, o quadro é mais sombrio. Um estudo que abrange cinco LLM e provas universitárias encontra uma concordância humano-máquina fraca e uma fiabilidade interna medíocre, com os modelos a inflacionar sobretudo as pontuações de coerência [2]. A combinação humano + IA melhora a fiabilidade face à IA isolada, o que defende modelos híbridos em vez de uma automatização total [3].
O risco mais preocupante é o da equidade. Alguns trabalhos mostram que as pontuações automatizadas divergem das pontuações humanas, em particular para os alunos de língua segunda [6]. Uma correção implementada sem auditoria de enviesamentos pode, assim, penalizar sistematicamente certos grupos, dando ao mesmo tempo a aparência de objetividade algorítmica.
Uma nota automatizada só é fiável se conhecermos os seus erros. A IA de correção deve ampliar o julgamento do professor, não confiscá-lo.
Síntese Learnya
O consenso emergente é claro: a IA distingue-se por gerar um feedback formativo rápido e por reduzir a carga de trabalho, mas a classificação de risco elevado deve permanecer sob controlo humano. É também uma exigência regulamentar: na União Europeia, a avaliação dos resultados de aprendizagem integra as utilizações de risco elevado enquadradas pelo AI Act. Automatizar, sim; abdicar do julgamento, não.
A distinção mais útil para implementar uma correção por IA opõe a avaliação formativa à avaliação sumativa. No plano formativo — para ajudar o aluno a progredir — um feedback rápido, mesmo imperfeito, tem valor: chega no momento certo e pode ser discutido. No plano sumativo — quando a nota conta e compromete o futuro — o menor erro ou o menor enviesamento torna-se inaceitável. É precisamente aí que a investigação recomenda manter o humano ao comando [5].
É preciso também compreender porque é que os modelos erram. Um LLM não «compreende» uma prova como um corretor: estima uma probabilidade a partir de regularidades textuais. Daí resultam artefactos documentados — sobrevalorização da coerência, sensibilidade à ordem dos critérios, ao comprimento ou ao estilo [4]. Estes enviesamentos não são aleatórios; podem favorecer uma forma de escrita em detrimento de outra, o que coloca um problema de equidade quando as populações diferem.
Na prática, uma correção assistida responsável calibra o modelo com base em provas já classificadas por humanos, mede explicitamente a concordância e a equidade entre grupos e reserva ao professor a validação final das decisões de risco elevado. A combinação humano + IA, mais fiável do que a IA isolada [3], não é um compromisso tímido: é a arquitetura que capta os ganhos de tempo sem abandonar a responsabilidade pedagógica e jurídica.
A chegada da IA não deveria apenas acelerar a correção existente; convida a repensar aquilo que avaliamos. Se um modelo redige uma dissertação correta em poucos segundos, a questão já não é apenas corrigir a dissertação, mas saber que competências queremos realmente certificar — raciocinar, argumentar, criar, colaborar — e como observá-las de forma fiável.
Os formatos em ascensão — provas orais, defesas, avaliação do processo, portefólios — são simultaneamente mais resistentes à IA e mais alinhados com as aprendizagens profundas. Aí a IA encontra plenamente o seu lugar como apoio do corretor: preparar, estruturar, assinalar, propor um primeiro feedback. O rumo é claro: automatizar o que pode sê-lo sem risco, reservar o julgamento humano às decisões que comprometem o futuro dos alunos e medir sem descanso a equidade do dispositivo.