Korrigieren mit KI: Wie weit kann man der Maschine vertrauen?
LLMs bewerten schnell und kostengünstig, doch Übereinstimmung mit dem Menschen, Verzerrungen und Chancengerechtigkeit bleiben ernste Hürden für eine vollständig automatisierte Korrektur.
LLMs bewerten schnell und kostengünstig, doch Übereinstimmung mit dem Menschen, Verzerrungen und Chancengerechtigkeit bleiben ernste Hürden für eine vollständig automatisierte Korrektur.
Korrigieren ist eine der zeitraubendsten Aufgaben des Unterrichtens. Die Idee, dafür LLMs einzusetzen, ist verlockend: Benotung von Kurzantworten, Bewertung von Aufsätzen, ja sogar ein „LLM als Richter“, das über die Qualität einer Arbeit entscheiden soll. Die Zeitgewinne sind real. Doch die Forschung 2025 mahnt, sorgfältig zu unterscheiden, was KI gut kann, von dem, was sie schlecht kann.
Bei kurzen und klar umrissenen Antworten erreichen die besten Modelle hohe Korrelationen mit menschlichen Korrektoren – bis hin zu sehr starken Werten in manchen Studien [1]. Die Benotung eng vorgegebener Formate (Definitionen, Berechnungen, faktische Items) ist das günstigste Terrain. Doch sobald die Antwort offen, technisch oder lang wird, nimmt die Streuung deutlich zu [1].
Bei Aufsätzen ist das Bild düsterer. Eine Studie zu fünf LLMs und universitären Arbeiten findet eine geringe Übereinstimmung zwischen Mensch und Maschine und eine mäßige interne Zuverlässigkeit, wobei die Modelle insbesondere die Kohärenzwerte aufblähen [2]. Die Kombination Mensch + KI verbessert die Zuverlässigkeit gegenüber der KI allein, was für hybride Modelle statt für eine vollständige Automatisierung spricht [3].
Das beunruhigendste Risiko betrifft die Chancengerechtigkeit. Untersuchungen zeigen, dass automatisierte Bewertungen von menschlichen Bewertungen abweichen, besonders bei Lernenden mit einer Zweitsprache [6]. Eine ohne Audit auf Verzerrungen ausgerollte Korrektur kann somit bestimmte Gruppen systematisch benachteiligen und dabei den Anschein algorithmischer Objektivität erwecken.
Eine automatisierte Note ist nur dann verlässlich, wenn man ihre Fehler kennt. Korrektur-KI soll das Urteil der Lehrkraft erweitern, nicht es an sich reißen.
Learnya-Synthese
Der sich abzeichnende Konsens ist eindeutig: KI glänzt darin, schnelle formative Rückmeldungen zu erzeugen und die Belastung zu senken, doch folgenreiche Benotung muss unter menschlicher Kontrolle bleiben. Das ist auch eine regulatorische Anforderung: In der Europäischen Union fällt die Bewertung von Lernergebnissen unter die Hochrisiko-Anwendungen, die der AI Act regelt. Automatisieren – ja; das Urteil abgeben – nein.
Die nützlichste Unterscheidung für den Einsatz einer KI-Korrektur stellt die formative Bewertung der summativen gegenüber. Im formativen Fall – um dem Schüler beim Fortschritt zu helfen – hat eine schnelle, wenn auch unvollkommene Rückmeldung Wert: Sie kommt zum richtigen Zeitpunkt und kann besprochen werden. Im summativen Fall – wenn die Note zählt und die Zukunft betrifft – wird der kleinste Fehler oder die geringste Verzerrung untragbar. Genau hier empfiehlt die Forschung, den Menschen am Steuer zu behalten [5].
Man muss auch verstehen, warum die Modelle sich irren. Ein LLM „versteht“ eine Arbeit nicht wie ein Korrektor: Es schätzt eine Wahrscheinlichkeit aus textlichen Regelmäßigkeiten. Daher die dokumentierten Artefakte – Überbewertung der Kohärenz, Empfindlichkeit gegenüber der Reihenfolge der Kriterien, der Länge oder dem Stil [4]. Diese Verzerrungen sind nicht zufällig; sie können eine Schreibform gegenüber einer anderen bevorzugen, was ein Problem der Chancengerechtigkeit aufwirft, wenn die Populationen sich unterscheiden.
In der Praxis kalibriert eine verantwortungsvolle assistierte Korrektur das Modell an bereits von Menschen benoteten Arbeiten, misst ausdrücklich die Übereinstimmung und die Gerechtigkeit zwischen Gruppen und behält der Lehrkraft die endgültige Bestätigung folgenreicher Entscheidungen vor. Die Kombination Mensch + KI, zuverlässiger als die KI allein [3], ist kein zaghafter Kompromiss: Sie ist die Architektur, die die Zeitgewinne einfängt, ohne die pädagogische und rechtliche Verantwortung aufzugeben.
Die Ankunft der KI sollte nicht nur die bestehende Korrektur beschleunigen; sie lädt dazu ein, neu zu denken, was man bewertet. Wenn ein Modell in wenigen Sekunden einen ordentlichen Aufsatz verfasst, geht es nicht mehr nur darum, den Aufsatz zu korrigieren, sondern darum zu wissen, welche Kompetenzen man wirklich zertifizieren will – schlussfolgern, argumentieren, erschaffen, zusammenarbeiten – und wie man sie zuverlässig beobachtet.
Die aufkommenden Formate – mündliche Prüfungen, Verteidigungen, Bewertung des Prozesses, Portfolios – sind zugleich widerstandsfähiger gegenüber KI und stärker auf tiefes Lernen ausgerichtet. KI findet hier ihren vollen Platz als Unterstützung des Korrektors: vorbereiten, strukturieren, hinweisen, eine erste Rückmeldung vorschlagen. Der Kurs ist klar: automatisieren, was ohne Risiko automatisiert werden kann, das menschliche Urteil den Entscheidungen vorbehalten, die die Zukunft der Lernenden betreffen, und unermüdlich die Gerechtigkeit des Systems messen.