Learnya/ Blog

Corrigir com IA: até onde podemos confiar na máquina?

Os LLM classificam depressa e a menor custo, mas a concordância com o humano, o enviesamento e a equidade continuam a ser obstáculos sérios a uma correção totalmente automatizada.

Estudante a redigir uma prova de exame na sala de aula
Alison wood, Wikimedia Commons  · CC BY 3.0

Corrigir é uma das tarefas mais morosas do ensino. A ideia de lhe aplicar os LLM é sedutora: classificação de respostas curtas, avaliação de dissertações, ou até um «LLM-juiz» encarregado de arbitrar a qualidade de uma produção. Os ganhos de tempo são reais. Mas a investigação de 2025 convida a distinguir cuidadosamente aquilo que a IA faz bem daquilo que faz mal.

Onde funciona: as respostas curtas

Em respostas curtas e bem delimitadas, os melhores modelos atingem correlações elevadas com os corretores humanos — chegando a valores muito fortes em alguns estudos [1]. A classificação de formato restrito (definições, cálculos, itens factuais) é o terreno mais favorável. Mas assim que a resposta se torna aberta, técnica ou longa, a variabilidade aumenta nitidamente [1].

Onde se complica: dissertações e julgamento

No caso das dissertações, o quadro é mais sombrio. Um estudo que abrange cinco LLM e provas universitárias encontra uma concordância humano-máquina fraca e uma fiabilidade interna medíocre, com os modelos a inflacionar sobretudo as pontuações de coerência [2]. A combinação humano + IA melhora a fiabilidade face à IA isolada, o que defende modelos híbridos em vez de uma automatização total [3].

O ponto cego da equidade

O risco mais preocupante é o da equidade. Alguns trabalhos mostram que as pontuações automatizadas divergem das pontuações humanas, em particular para os alunos de língua segunda [6]. Uma correção implementada sem auditoria de enviesamentos pode, assim, penalizar sistematicamente certos grupos, dando ao mesmo tempo a aparência de objetividade algorítmica.

  • Bom para: respostas curtas, feedback formativo rápido, pré-seleção.
  • A enquadrar: dissertações, classificação sumativa, decisões de risco elevado.
  • A auditar sistematicamente: enviesamentos linguísticos, culturais e de formato.

Uma nota automatizada só é fiável se conhecermos os seus erros. A IA de correção deve ampliar o julgamento do professor, não confiscá-lo.

Síntese Learnya

O consenso emergente é claro: a IA distingue-se por gerar um feedback formativo rápido e por reduzir a carga de trabalho, mas a classificação de risco elevado deve permanecer sob controlo humano. É também uma exigência regulamentar: na União Europeia, a avaliação dos resultados de aprendizagem integra as utilizações de risco elevado enquadradas pelo AI Act. Automatizar, sim; abdicar do julgamento, não.

Formativo primeiro, sumativo com prudência

A distinção mais útil para implementar uma correção por IA opõe a avaliação formativa à avaliação sumativa. No plano formativo — para ajudar o aluno a progredir — um feedback rápido, mesmo imperfeito, tem valor: chega no momento certo e pode ser discutido. No plano sumativo — quando a nota conta e compromete o futuro — o menor erro ou o menor enviesamento torna-se inaceitável. É precisamente aí que a investigação recomenda manter o humano ao comando [5].

É preciso também compreender porque é que os modelos erram. Um LLM não «compreende» uma prova como um corretor: estima uma probabilidade a partir de regularidades textuais. Daí resultam artefactos documentados — sobrevalorização da coerência, sensibilidade à ordem dos critérios, ao comprimento ou ao estilo [4]. Estes enviesamentos não são aleatórios; podem favorecer uma forma de escrita em detrimento de outra, o que coloca um problema de equidade quando as populações diferem.

Na prática, uma correção assistida responsável calibra o modelo com base em provas já classificadas por humanos, mede explicitamente a concordância e a equidade entre grupos e reserva ao professor a validação final das decisões de risco elevado. A combinação humano + IA, mais fiável do que a IA isolada [3], não é um compromisso tímido: é a arquitetura que capta os ganhos de tempo sem abandonar a responsabilidade pedagógica e jurídica.

A avaliação a repensar, não apenas a automatizar

A chegada da IA não deveria apenas acelerar a correção existente; convida a repensar aquilo que avaliamos. Se um modelo redige uma dissertação correta em poucos segundos, a questão já não é apenas corrigir a dissertação, mas saber que competências queremos realmente certificar — raciocinar, argumentar, criar, colaborar — e como observá-las de forma fiável.

Os formatos em ascensão — provas orais, defesas, avaliação do processo, portefólios — são simultaneamente mais resistentes à IA e mais alinhados com as aprendizagens profundas. Aí a IA encontra plenamente o seu lugar como apoio do corretor: preparar, estruturar, assinalar, propor um primeiro feedback. O rumo é claro: automatizar o que pode sê-lo sem risco, reservar o julgamento humano às decisões que comprometem o futuro dos alunos e medir sem descanso a equidade do dispositivo.

Fontes

  1. 1. LLM-as-a-Grader: Practical Insights from Large Language Model for Short-Answer and Report Evaluation , Byun, G., Rajwal, S., & Choi, J. D. , arXiv , 2025 https://arxiv.org/abs/2511.10819
  2. 2. Assessing the Reliability and Validity of Large Language Models for Automated Assessment of Student Essays in Higher Education , Gaggioli, A., Casaburi, F., Ercolani, G., Collova, F., Torre, F., & Davide, F. , arXiv , 2025 https://arxiv.org/abs/2508.02442
  3. 3. Exploring LLM Autoscoring Reliability in Large-Scale Writing Assessments Using Generalizability Theory , Song, D., Lee, W.-C., & Jiao, H. , arXiv , 2025 https://arxiv.org/abs/2507.19980
  4. 4. Evaluating Scoring Bias in LLM-as-a-Judge , Li, Q., Dou, S., Shao, K., Chen, C., & Hu, H. , arXiv , 2025 https://arxiv.org/abs/2506.22316
  5. 5. Evaluating large language models as graders of medical short answer questions: a comparative analysis with expert human graders , Bolgova, O., Ganguly, P., Ikram, M., & Mavrych, V. , Medical Education Online , 2025 https://pmc.ncbi.nlm.nih.gov/articles/PMC12377152/
  6. 6. Evaluating LLM-Based Automated Essay Scoring: Accuracy, Fairness, and Validity , Huang, Y., & Wilson, J. , ACL Anthology (AIME-Con) , 2025 https://aclanthology.org/2025.aimecon-wip.9/
  7. 7. LLM-based Automated Grading with Human-in-the-Loop (GradeHITL) , Chu, H., Li, Y., Yang, T., Copur-Gencturk, Y., & Tang, J. , arXiv / IEEE TALE 2025 , 2025 https://arxiv.org/abs/2504.05239
← Todos os artigos