KI-Tutoren: Der alte Traum vom Privatlehrer, wirklich in Reichweite?
Kontrollierte Studien zeigen, dass gut konzipierte KI-Tutoren mit aktivem Unterricht mithalten – doch die Kluft zwischen Forschungsprototyp und Produkt bleibt groß.
Kontrollierte Studien zeigen, dass gut konzipierte KI-Tutoren mit aktivem Unterricht mithalten – doch die Kluft zwischen Forschungsprototyp und Produkt bleibt groß.
1984 formulierte Benjamin Bloom eine Herausforderung, die berühmt werden sollte: Ein Schüler, der individuell und nach dem Prinzip des zielerreichenden Lernens (Mastery Learning) betreut wurde, machte etwa zwei Standardabweichungen mehr Fortschritt als im gewöhnlichen Klassenunterricht – das „Zwei-Sigma-Problem“ [1]. Menschliche Betreuung funktionierte, ließ sich aber wirtschaftlich nicht verallgemeinern. Vierzig Jahre später beleben die großen Sprachmodelle dieses Versprechen neu: ein geduldiger, verfügbarer Privatlehrer für jede lernende Person. Die Belege beginnen einzutreffen, und sie sind vielschichtiger als die Marketing-Demonstrationen.
2025 verglich eine randomisierte Studie in Harvard einen nach pädagogischen Prinzipien konzipierten KI-Tutor mit einem Kurs im aktiven Lernen: Die Studierenden mit dem KI-Tutor lernten mehr, in kürzerer Zeit, und gaben an, engagierter zu sein [2]. Eine weitere Studie in Sekundarschulklassen im Vereinigten Königreich zeigte, dass Schülerinnen und Schüler, die von einem auf LearnLM basierenden System angeleitet wurden, mindestens so gut abschnitten wie jene, die von einem menschlichen Tutor begleitet wurden, und neue Aufgaben etwas besser lösten [3].
KI kann den menschlichen Tutor auch erweitern, statt ihn zu ersetzen. In der Studie Tutor CoPilot hob ein KI-Kopilot, der den Tutoren in Echtzeit Vorschläge einflüsterte, die Kompetenzrate der Schülerinnen und Schüler im Durchschnitt um 4 Punkte an – und um 9 Punkte bei jenen, die von den am schlechtesten bewerteten Tutoren begleitet wurden – für rund 20 Dollar pro Tutor und Jahr [4].
Nicht alle Studien kommen zu einem positiven Effekt. Eine Evaluation von Khanmigo für das Erlernen wissenschaftlicher Konzepte fand keinen statistisch signifikanten Unterschied zu einer einfachen Google-Suche, auch wenn die Studierenden das Werkzeug positiv wahrnahmen [5]. Vor allem bleibt die pädagogische Kompetenz der Modelle uneinheitlich: In einer geteilten Bewertungsaufgabe erreichten die besten KI-Tutoren nur bescheidene Werte darin, die Fehler der Schülerinnen und Schüler zuverlässig zu erkennen und zu korrigieren [6].
Ein vielversprechender Ansatz besteht darin, die Modelle anhand echter Betreuungssitzungen zu spezialisieren. Das Projekt TeachLM, trainiert auf Tausenden Stunden authentischer Einzelbetreuung, verdoppelte die Sprechzeit der lernenden Person und erhöhte die Zahl der Wortwechsel, mit einem Fragestil, der dem einer guten Lehrkraft näherkommt [7]. Mit anderen Worten: Ein guter KI-Tutor spricht nicht mehr – er bringt die Schülerin oder den Schüler dazu, mehr zu sprechen und nachzudenken.
Das Ziel ist nicht ein Modell, das gut antwortet, sondern ein Modell, das lernen lässt – zwei verschiedene Kompetenzen.
Learnya-Synthese
Für die Einrichtungen – insbesondere in Europa und der Schweiz, die auf Datenschutz achten – geht es um mehr als um Leistung: Ein KI-Tutor verarbeitet sensible Lerndaten und muss sich in eine beherrschte Governance einfügen. Blooms Traum wird technisch glaubwürdig, doch er entscheidet sich in den Details von Gestaltung, Beleg und Vertrauen, nicht allein in der Leistungsfähigkeit des Modells.
Ein Punkt verdient Hervorhebung: Die meisten ermutigenden Ergebnisse stammen von Systemen, die von Forschungsteams sorgfältig konzipiert und unter beherrschten Bedingungen getestet wurden. Der Schritt zu einem Produkt, das in Hunderten von Klassen ausgerollt wird – mit fachfremden Lehrkräften, instabilen Verbindungen und unterschiedlichen Lehrplänen –, bleibt ein beträchtlicher Sprung. Ein Tutor, der im Labor glänzt, kann unter realen Bedingungen enttäuschen, wenn seine Einbindung in den Unterricht, seine Robustheit und seine Wartung nicht mitgedacht wurden.
Die Qualität der Belege selbst verlangt Differenzierung. Die geteilten Bewertungsaufgaben zeigen, dass die Modelle noch Mühe haben, einen Fehler fein zu diagnostizieren oder den richtigen Hinweis zu wählen [6]. Viele Studien konzentrieren sich auf ein einziges Fach, über eine kurze Dauer, und messen unmittelbare Zugewinne. Es fehlt noch an Längsschnittuntersuchungen, die die Behaltensleistung mehrere Monate später oder die Wirkung auf Motivation und Autonomie langfristig überprüfen würden.
Schließlich existiert ein KI-Tutor nie allein: Er fügt sich in eine Klassenökologie ein. Die besten Ergebnisse verbinden KI und Lehrkraft, wie die Studie zeigt, in der das System vor allem die unerfahrensten Tutoren unterstützt. Die richtige Frage lautet also nicht „Ist die KI so gut wie ein Mensch?“, sondern „Welche Rollenverteilung maximiert das Lernen?“. Das ist eine Frage der pädagogischen und organisatorischen Gestaltung, nicht allein des Modells.
Das Feld tritt in eine Phase der Reife ein, in der sich die Fragen wandeln. Man fragt nicht mehr nur, ob ein KI-Tutor eine Schülerin oder einen Schüler voranbringen kann, sondern unter welchen Bedingungen, für welche Profile und zu welchen realen pädagogischen Kosten. Künftige Studien müssen nicht die KI mit dem Nichts vergleichen, sondern verschiedene Tutor-Konzepte miteinander, und die Effekte über mehrere Monate verfolgen.
Drei Baustellen werden dominieren: die Robustheit unter realen Bedingungen, fernab der Labore; das Zusammenspiel mit der Arbeit der Lehrkraft, die der Orchestrator des Sinns bleibt; und die Beherrschung der Lerndaten als Bedingung für das Vertrauen der Familien. Der ideale Tutor wird nicht der redseligste sein, sondern jener, der weiß, wann er schweigen muss, um die Schülerin oder den Schüler suchen zu lassen – und der Rechenschaft darüber ablegt, was er mit deren Daten tut.