The Brief
Wie KI funktioniert 5 Min. Lesezeit

AGI ist "da". Die Definition verschiebt sich nur ständig

NAVION

Teilen

OpenAI-Präsident Greg Brockman hat kürzlich erklärt, dass die “AGI-Ära” begonnen hat, im Anschluss an den Launch von GPT-6 Astra. Nvidia-CEO Jensen Huang hat die Ankündigung öffentlich bekräftigt. Die Behauptung hatte erhebliches Gewicht: Künstliche allgemeine Intelligenz, lange Zeit als der ferne Horizont der KI-Forschung behandelt, wurde als gegenwärtige Realität präsentiert. Das Problem ist, dass sich fast niemand außerhalb dieser Unternehmen einig ist, was diese Realität eigentlich bedeutet.

Ein Benchmark-Score, der sich mit der Software ändert

Astras am häufigsten zitierten Beweise für Fähigkeiten auf AGI-Niveau sind seine Leistungen bei ARC-AGI-3, einem Benchmark, der vom KI-Forscher François Chollet speziell dafür entwickelt wurde, sich genau jener Art von zielgerichtetem Training zu widersetzen, die viele KI-Tests unzuverlässig gemacht hat. Der Benchmark platziert Modelle in ungewohnte Videospielumgebungen und misst, ob sie die Regeln herausfinden, sich anpassen und gewinnen können. Er ist konstruktionsbedingt schwerer zu manipulieren als die meisten anderen.

Astra hat sich bemerkenswert gut geschlagen. Unter Verwendung von OpenAIs eigener Testumgebung, der Softwareschicht, die zwischen dem Modell und dem Benchmark vermittelt, erreichte es 99,9 %. Unter Verwendung des standardmäßigen Testsetups von ARC-AGI-3, das dafür entwickelt wurde, allen Modellen eine einheitlichere Schnittstelle zu geben, fiel der Score auf 62,7 %. Diese Lücke ist keine kleine technische Fußnote. Sie wirft eine direkte Frage auf: Ist das Modell wirklich fähig, oder ist es teilweise für die Bedingungen optimiert, unter denen es evaluiert wird?

Chollet selbst hat sich dazu direkt geäußert. Der Benchmark, erklärte er, testet eine nicht-exhaustive Menge von Attributen in kleinem Maßstab. Intelligenz in der echten Welt erfordert weitaus längere Zeithorizonte für das Lernen, eine weitaus größere Komplexität bei der Modellierung der Welt und weitaus mehr doppeldeutige Ziele. Das Lösen von ARC-AGI-3 ist seiner Ansicht nach ein bedeutsames Zeichen des Fortschritts. Es ist kein Beweis für AGI, und es war nie als das gedacht.

Das Definitionsproblem ist die eigentliche Story

Hier ist, was die meiste Berichterstattung über diese Ankündigung verpasst: Die Debatte darüber, ob AGI angekommen ist, ist untrennbar mit der Debatte darüber verbunden, was AGI überhaupt bedeutet. Es gibt keine universell akzeptierte Definition, und diese Abwesenheit schafft erheblichen Spielraum für Interpretation.

OpenAIs aktuelle Definition beschreibt AGI als “hochgradig autonome Systeme, die Menschen bei der meisten ökonomisch wertvollen Arbeit übertreffen”. Das Center for AI Safety verwendet einen anspruchsvolleren Rahmen, der hohe Leistung in zehn verschiedenen kognitiven Domänen erfordert, die von Schlussfolgerungen über Gedächtnis bis hin zu Wahrnehmung reichen. Unabhängige Forscher arbeiten oft mit Definitionen, die noch strenger sind.

Gary Marcus, Professor an der New York University und ein prominenter KI-Skeptiker, bezeichnete die AGI-Behauptung als Marketing und argumentierte, dass sie entweder die ursprünglichen Definitionen des Begriffs missversteht oder die Messlatte absichtlich niedriger hängt. Sein Punkt über Astras Leistung auf dem Epoch Capabilities Index ist lehrreich: Astra hat zwar einen neuen Rekord aufgestellt und 169 Punkte erzielt gegenüber einem vorherigen Höchstwert von 163, aber die eigene Analyse von Epoch AI ergab, dass die Verbesserung im Einklang mit der bestehenden Trajektorie des KI-Fortschritts blieb. Ein neuer Rekord, ja. Ein diskontinuierlicher Sprung, nein.

Ben Goertzel, der Forscher, der den Begriff “künstliche allgemeine Intelligenz” im Jahr 2005 geprägt hat, bot vielleicht die präziseste Formulierung. Nach der Nutzung von Astra war seine Einschätzung, dass das Modell in bestimmten Bereichen übermenschlich ist, insbesondere in Mathematik und Programmierung, während es in anderen schwächer bleibt. Es mit einem menschlichen Wesen zu vergleichen, sagte er, “läuft am Ende auf etwas Kompliziertes hinaus anstelle eines einfachen Ja oder Nein”. Er identifizierte auch spezifische Lücken, die Software-Gerüste nicht schließen können: wie das Modell sich selbst versteht, wie es Gedächtnis über seine Erfahrung hinweg behält und anwendet und wie es konkurrierende Ziele koordiniert.

Andy Konwinski, Mitgründer von Databricks, Perplexity und Laude, drückte es noch direkter aus. Diese Systeme können noch nicht über lange Zeiträume hinweg unabhängig denken. Sie können komplexe Software schreiben und Bugs identifizieren, aber der Großteil des Wertes der Welt kommt nicht aus der Softwaretechnik. Sie bauen keine Nahrung an, errichten keine Infrastruktur und regieren keine Gesellschaften.

Warum das Label jenseits des Labors wichtig ist

Die AGI-Debatte mag wie ein technischer Streit unter Forschern wirken, aber ihre Implikationen gehen weit über Benchmark-Scores hinaus. Wenn einflussreiche Persönlichkeiten in der Industrie erklären, dass eine Schwelle überschritten wurde, prägt das die öffentlichen Erwartungen, politische Gespräche, Investitionsentscheidungen und die Art und Weise, wie Menschen die Technologie verstehen, neben der sie zunehmend leben.

Brockman ist nicht der Erste, der diese Art von Erklärung abgibt. Huang hat Anfang des Jahres eine ähnliche Behauptung aufgestellt. OpenAI-CEO Sam Altman hat den aktuellen Moment als den Beginn der Singularität beschrieben, einer Phase, in der KI-Systeme die Entwicklung neuer Modelle übernommen und beschleunigt haben, wobei Menschen weitgehend aus dieser Schleife herausgenommen sind. Jede dieser Aussagen hat genau deshalb Gewicht, weil sie von diesen Personen getätigt wird, und jede einzelne kommt ohne einen geteilten Standard daher, an dem man die Behauptung messen könnte.

Die Analogien zum Mobilfunknetz passen gut: Netzbetreiber haben ihre Netzwerke in der Vergangenheit historisch mit der Markierung der nächsten Generation versehen, bevor die zugrundeliegende Technologie den technischen Standard vollständig erfüllte. Das Label treibt die Adoption und die Wahrnehmung an. Die Lücke zwischen dem Label und der Realität schließt sich später, ganz leise.

Die KI-Fähigkeiten schreiten voran. Das steht nicht zur Debatte. Was wirklich ungelöst bleibt, ist, ob das Konzept von AGI, so wie es von den Leuten definiert und umdefiniert wurde, die am meisten motiviert sind, es zu erreichen, immer noch irgendetwas Präzises genug beschreibt, um bedeutsam zu sein.

Kurz gesagt

GPT-6 Astra ist ein fähiges Modell, und seine Benchmark-Ergebnisse repräsentieren echten Fortschritt. Aber die Behauptung, AGI sei angekommen, ruht auf einer Definition, die von den Unternehmen, welche die Behauptung aufstellen, so geformt wurde, dass sie zu ihren eigenen Systemen passt. Forscher, die den Begriff geprägt, die Benchmarks entworfen und KI unabhängig studiert haben, sind nicht überzeugt. Das Wichtigste, was man verstehen muss, ist nicht, ob AGI da ist. Es ist, dass die Antwort vollständig davon abhängt, wer die Frage definieren darf.

Basierend auf Berichten von Fast Company - Tech.

Geschrieben von

NAVION