Stimme, Bild, Text: Die multimodale KI hält Einzug ins Klassenzimmer
Tutoren, die eine Skizze sehen, ein lautes Vorlesen hören und ein Heft lesen: Wo die multimodale KI in der Bildung wirklich steht.
Tutoren, die eine Skizze sehen, ein lautes Vorlesen hören und ein Heft lesen: Wo die multimodale KI in der Bildung wirklich steht.
Bis 2023 sprach die Bildungs-KI vor allem Text. Das Aufkommen multimodaler Modelle – die Text, Bild, Audio und mitunter Video gemeinsam verarbeiten können – verändert die Natur der möglichen Interaktionen. Eine lernende Person kann eine handschriftliche Geometrieaufgabe abfotografieren, eine Passage laut vorlesen, um die Aussprache zu üben, oder eine biologische Skizze zeigen und um eine Erklärung bitten. Aktuelle Übersichtsarbeiten zu LLMs in der Bildung benennen diesen multimodalen Umbruch als eine der zentralen Entwicklungslinien für die Jahre 2025-2027 [1].
Diese Fähigkeiten stützen sich auf neuere Modelle, die gesprochene Sprache in Ein- und Ausgabe nahezu nativ verarbeiten und damit den Weg zu glaubwürdigen dialogfähigen Tutoren ebnen. Auf der Forschungsseite nutzt die multimodale Lernanalyse (multimodal learning analytics) inzwischen Sensoren, Stimme und Nutzungsspuren, um bislang unsichtbare Prozesse wie die Zusammenarbeit oder das Engagement fein zu erfassen [2].
Die Begeisterung muss gedämpft werden. Multimodale Modelle werden oft danach bewertet, ob sie ein wissenschaftliches Problem lösen können, nicht ob sie es lehren können. Eine aktuelle Studie zeigt, dass ein im Lösen hervorragendes Modell ein schlechter Tutor sein kann: Es gibt die Antwort, statt zu leiten, oder erklärt eine Abbildung mangelhaft [3]. Die didaktische Kompetenz – die richtige Frage stellen, den Fehler diagnostizieren, den Hinweis dosieren – korreliert nicht mit der reinen Leistung.
Die Lehrkräfte selbst äußern präzise Erwartungen und Vorbehalte. Eine Befragung von Lehrenden der Primar- und Sekundarstufe zeigt ein starkes Interesse an multimodalen Anwendungen (Korrektur handschriftlicher Arbeiten, mündliches Feedback), aber auch Sorgen hinsichtlich der Verlässlichkeit, des Prüfaufwands und des Schutzes der Schülerdaten [4].
Stimme, Gesichter, Handschriften, Unterrichtsvideos: Multimodale Daten sind sensibler als anonymer Text. Die Stimme ist ein biometrisches Datum; das Bild einer minderjährigen Person unterliegt einem verstärkten Schutz. Die UNESCO erinnert daran, dass der Einsatz von Bildungs-KI dem Datenschutz und einer am Menschen orientierten Sichtweise untergeordnet werden muss [5], und der AI-Index-Bericht 2025 hebt die anhaltende Kluft zwischen Verbreitung und Regulierung hervor [6]. Für europäische und Schweizer Einrichtungen spricht das für Architekturen, in denen die multimodale Verarbeitung unter Kontrolle bleibt – idealerweise souverän – statt an undurchsichtige Dienste ausgelagert zu werden.
Die Multimodalität bringt die KI nicht nur der Art näher, wie Menschen kommunizieren; sie bringt auch die Risiken der Art näher, wie Menschen identifizierbar sind.
Learnya-Synthese
In der Praxis wird der Wert der multimodalen KI in der Bildung weniger von der technischen Meisterleistung abhängen als von drei Bedingungen: einer didaktischen Gestaltung, die das Anleiten über die Lösung stellt, einer menschlichen Überprüfung sensibler Ausgaben und einer strengen Governance der multimodalen personenbezogenen Daten.
Die Multimodalität entfaltet ihren vollen Sinn, wenn man auf die Ebene der Fächer hinabsteigt. In den Sprachen ermöglicht ein Sprachtutor die Arbeit an Aussprache und Sprechflüssigkeit, mit einer Rückmeldung, die schriftlich unmöglich wäre. In Mathematik und den Naturwissenschaften verändert die Fähigkeit, eine handschriftliche Skizze oder eine Abbildung zu lesen, die Ausgangslage für Korrektur und Erklärung. In Kunst und Geschichte eröffnet die Bildanalyse gehaltvolle Dialoge über Werke und Dokumente.
Doch jede Modalität fügt ihre eigene Fehleranfälligkeit hinzu. Die Spracherkennung stößt an Akzenten und Lärm an ihre Grenzen; das Lesen von Bildern verwechselt ähnliche Symbole oder halluziniert ein Detail. Solche Fehler sind umso trügerischer, als sie von einer selbstsicheren Antwort begleitet werden [3]. In der Bildung, wo die lernende Person vertraut, kann sich ein nicht kenntlich gemachter multimodaler Fehler dauerhaft festsetzen. Die menschliche Überprüfung sensibler Ausgaben bleibt daher unverzichtbar.
Schließlich stellt sich die Frage der Daten mit besonderer Schärfe. Die Verarbeitung der Stimme, des Gesichts oder der Schrift einer minderjährigen Person fällt unter sensible, oft biometrische Kategorien. Die Referenzrahmen – allen voran die UNESCO [5] – ordnen den Einsatz dem Datenschutz und einem klaren pädagogischen Zweck unter. Architekturen, die die multimodale Verarbeitung nah an der Einrichtung und unter Kontrolle halten, bieten den besten Kompromiss zwischen Anwendungsreichtum und Vertrauen.
Die Multimodalität bringt die KI der Art näher, wie man wirklich lehrt und lernt: durch Sprache, Geste, Bild, Handhabung. Das ist ein echter Fortschritt für die Barrierefreiheit und für die Verankerung des Lernens im Konkreten. Doch je mehr die KI wahrnimmt, desto mehr weiß sie über die lernende Person – und desto größer ist die Verantwortung derjenigen, die sie einsetzen.
Am Horizont der Jahre 2026-2027 werden sich Sprachtutoren und Assistenten, die ein Heft lesen können, zweifellos vervielfachen. Die Trennlinie zwischen verantwortungsvollen und riskanten Anwendungen verläuft über die Governance: welche multimodalen Daten erfasst werden, wo sie verarbeitet werden, wie lange sie aufbewahrt werden und wer auf sie zugreift. Der Reichtum der Modalitäten hat nur dann Wert, wenn er von einer ebenso großen Sorgfalt beim Schutz der Personen begleitet wird.