Seit mindestens 100.000 Jahren konnte nur eine Art von Wesen auf der Erde eine menschliche Sprache fließend erlernen: ein menschliches Kind. Das hat sich vor etwa vier Jahren geändert. Large language models können mittlerweile Unterhaltungen führen, die oberflächlich betrachtet von menschlichen Gesprächen nicht zu unterscheiden sind. Und doch passiert unterhalb dieser sprachlichen Gewandtheit etwas zutiefst Merkwürdiges. Diese Systeme benötigen eine astronomische Menge an Daten, um ein Kompetenzniveau zu erreichen, das ein Kleinkind fast mühelos erlangt. Zu verstehen, warum diese Kluft existiert, ist heute eine der folgenreichsten offenen Fragen sowohl in der Kognitionswissenschaft als auch in der KI-Forschung.
Das Ausmaß des Problems ist schwer zu fassen
Die beteiligten Zahlen sind kaum vorstellbar. Ein Kind im Vorpupertätsalter, das in einer sprachlich reichen Umgebung aufgewachsen ist, hat bis zu seiner Adoleszenz vielleicht rund 100 Millionen Wörter gehört. Nimmst du das Lesen noch dazu, steigt dieser Wert bis zum 20. Lebensjahr auf etwa 300 Millionen Wörter. Das Open-Weight-Modell Llama 3.1 von Meta wurde im Gegensatz dazu mit 15 Billionen Token trainiert, wobei Token wortähnliche Einheiten der Sprache sind. Frontier-Modelle werden möglicherweise mit der zehnfachen Menge trainiert, laut Ethan Gotlieb Wilcox, einem Kognitionswissenschaftler und Linguisten an der Georgetown University.
Um den Kontrast greifbar zu machen: Wenn du alle Wörter ausdruckst, die zum Training eines modernen large language model verwendet wurden, würde der Papierstapel über die Internationale Raumstation hinausreichen. Die 100 Millionen Wörter, die ein Kind vor der Pubertät gehört hat, würden einen Stapel von etwa 20 Metern Höhe ergeben. Wilcox drückt es anders aus: Claude hat die Menge an Sprache gesehen, die eine ganze Stadt in einer Generation erlebt.
Das ist es, was Forscher die Dateneffizienzlücke nennen. Kinder lernen Sprache aus einem Bruchteil des Inputs, den Maschinen benötigen, und sie tun dies schneller, zuverlässiger und mit weit weniger expliziter Anleitung. Kleinkinder beginnen in der Regel, grammatikalisch korrekte Sätze zu bilden, nachdem sie irgendwo zwischen 10 und 30 Millionen Wörter gehört haben. GPT-2 mit 30 Millionen Wörtern zu trainieren, wie Michael C. Frank, ein Kognitionswissenschaftler an der Stanford University, betont, erzeugt einen Unsinn-Generator. Es bringt nichts hervor, was auch nur entfernt einem Kind gleicht.
Eine Debatte, die sowohl die Linguistik als auch die KI geprägt hat
Die Frage, wie Kinder Sprache erwerben, ist nicht neu, und die konkurrierenden Antworten darauf hatten reale Konsequenzen für die Entwicklung der KI. In den 1950er Jahren argumentierte der MIT-Linguist Noam Chomsky, dass Kinder mit fest verdrahtetem grammatikalischem Wissen geboren werden. Seine Begründung war, dass Sprache, insbesondere ihre Syntax, zu komplex und die Konfrontation der Kinder damit zu begrenzt ist, als dass das Lernen rein durch Erfahrung stattfinden könnte. Er nannte dies die “Armut des Reizes”. Ihm gegenüber stand der Psychologe B.F. Skinner, der vertrat, dass Sprache vollständig durch konditionelle Umweltfaktoren erlernt wird, genau wie Tiere lernen, auf Belohnungen zu reagieren.
Chomskys Sichtweise dominierte die amerikanische Linguistik jahrzehntelang und prägte die frühe KI-Forschung direkt. Forscher versuchten, Computern Sprache beizubringen, indem sie grammatikalische Regeln explizit in Programme codierten, ein regelbasierter Ansatz, der Teil der sogenannten symbolischen KI wurde. Dieser Ansatz schaffte es größtenteils nicht, Systeme hervorzubringen, die in der Lage sind, echte menschliche Sprache in großem Maßstab zu verarbeiten. Das Interesse an diesem Bereich kühlte während der Periode, die als KI-Winter bekannt ist und in den 1970er Jahren begann, erheblich ab.
Das Comeback kam über einen völlig anderen Weg. Neuronale Netze, die durch das Erkennen statistischer Muster lernen, anstatt expliziten Regeln zu folgen, begannen regelbasierte Systeme zu übertreffen, als die Hardware billiger wurde und das Internet riesige Mengen an Text lieferte. In den Jahren 2018 und 2019 zeigten Modelle wie BERT und GPT-2, die auf einer neuen Architektur namens Transformer basieren, dass das Lernen aus massiven Datenmengen für Sprache funktionieren kann. Der Erfolg von ChatGPT im Jahr 2022 machte das für die breite Öffentlichkeit sichtbar.
Die Ironie ist offenkundig. Large language models sind im Wesentlichen genau die Art von statistischen Lernmaschinen, von denen Chomsky argumentierte, dass sie niemals Sprache erwerben könnten. Sie haben keine angeborene Grammatik, keine fest verdrahteten Regeln, keine biologische Architektur. Und doch funktionieren sie, zumindest im großen Maßstab. Kinder hingegen vollbringen dieselbe Leistung mit einem Bruchteil der Daten und völlig ohne diese Recheninfrastruktur. Keine Seite der alten Debatte erklärt den jeweiligen Fall vollständig.
Warum diese Frage über das Labor hinaus wichtig ist
Hier gibt es eine praktische Dringlichkeit, die über akademische Debatten hinausgeht. Das Internet ist nicht unendlich. Forscher deuten an, dass der Vorrat an leicht verfügbaren Textdaten für das Training bereits in den 2030er Jahren zur Neige gehen könnte. Wenn KI-Systeme sich nur verbessern können, indem sie mehr Daten konsumieren, hat diese Entwicklungskurve eine Obergrenze. Kinder demonstrieren, dass diese Obergrenze nicht fundamental ist. Sie ist eine Beschränkung der aktuellen Methoden, nicht der Aufgabe an sich.
Das Schließen der Dateneffizienzlücke könnte Möglichkeiten eröffnen, die aktuelle Modelle nicht erreichen können: KI-Systeme, die effektiv mit Video statt mit Text trainiert werden, Sprachwerkzeuge für Minderheitensprachen, bei denen große Textkorpora schlicht nicht existieren, und Modelle, die wie Menschen von begrenzten Beispielen auf das Allgemeine schließen. Die Untersuchung, wie Kinder lernen, bietet zudem eine Möglichkeit, langjährige Hypothesen über den menschlichen Geist zu testen, einschließlich der Frage, ob der Spracherwerb angeborene biologische Strukturen erfordert oder ob die richtige Art von Lernumgebung ausreicht.
Was dieser Forschungsbereich eigentlich fragt, ist eine Version einer viel älteren Frage: Was bedeutet es, Sprache zu verstehen, und wie viel von diesem Verständnis ist einzigartig menschlich? Die KI hat diese Frage nicht beantwortet. Sie hat sie dringlicher gemacht.
Kurz gesagt
Kinder lernen Sprache aus einem Bruchteil der Daten, die KI-Systeme benötigen, eine Lücke, die so groß ist, dass sie sich nur durch Analogien beschreiben lässt. Forscher untersuchen, wie Kinder das schaffen, weil die Antwort die Bauweise von KI-Modellen verändern könnte und weil der Vorrat an Trainingsdaten Grenzen hat. Die Debatte zwischen angeborenem Wissen und statistischem Lernen, die sowohl die Linguistik als auch die frühe KI prägte, ist nach wie vor ungelöst. Large language models sind ein starker Beweis dafür, dass Statistiken sehr weit führen können. Kinder sind ein ebenso starker Beweis dafür, dass Statistiken allein nicht die ganze Geschichte sind.
Basierend auf Berichten von MIT Technology Review.