KI

OpenAI erklärt AGI für erreicht. Der zitierte Benchmark misst 37 Punkte weniger

Adrian Kessler

Jensen Huangs Post auf X bestand aus einem Satz und einem Glückwunsch: „Von ChatGPT zu o1 zu Astra in 4 Jahren, AGI ist angekommen. Herzlichen Glückwunsch @OpenAI Team.“ Er schickte ihn am 6. September. Drei Tage zuvor hatte Greg Brockman, Präsident von OpenAI, gegenüber der Presse fast die gleiche Formulierung verwendet: „Willkommen im AGI-Zeitalter.“ Die Erklärungen kamen dicht beieinander, von zwei Männern mit komplementären Interessen, und wurden weitgehend als Bestätigung aufgefasst.

Der Benchmark hinter der Behauptung war ARC-AGI-3. OpenAI erklärte, Astra, sein neues Grenzmodell, das unter der Bezeichnung GPT-6 veröffentlicht wurde, habe 99,9% bei ARC-AGI-3 und 98% bei FrontierMath Tier 4 erreicht. Ergebnisse auf diesem Niveau unter Standardbedingungen würden eine echte Diskontinuität darstellen – ein Modell, das nicht nur gut abschneidet, sondern in Gebiete vordringt, die frühere Benchmarks als erstrebenswert behandelt hatten. Die Organisation, die ARC-AGI-3 entwickelt hat, veröffentlichte eine Punktzahl aus ihrem standardisierten Evaluierungsrahmen: 62,7%.

Siebenunddreißig Prozentpunkte trennen diese beiden Zahlen. Beide stammen aus echten Evaluierungen. Der interne Evaluierungsrahmen von OpenAI und der Referenzrahmen der Benchmark-Ersteller sind nicht dasselbe Protokoll, und dasselbe Modell erzielt unter jedem unterschiedliche Ergebnisse. Was die ARC-AGI-3-Organisation als ihre Referenzbedingung verwendet – diejenige, die sie für gültig hält, um Modelle feldweit zu vergleichen – ergab 62,7%. Das interne Setup von OpenAI ergab 99,9%. Der Unterschied zwischen diesen Zahlen ist der Unterschied zwischen einem starken Benchmark-Ergebnis und einer Ankunftserklärung.

Der Chipverkauf hinter der AGI-Gratulation

Astra wurde auf NVIDIA-Chips trainiert. Huang verkauft NVIDIA-Chips. Wenn ein CEO einer Kunden öffentlich gratuliert, einen historischen Schwellenwert überschritten zu haben – einen Schwellenwert, der die Hardware, die zum Bau dieses Produkts verwendet wurde, zur definierenden Infrastruktur für das macht, was als nächstes kommt – dann ist die Ankündigung strukturell eine kommerzielle Behauptung. Keine Verschwörung. Eine strukturelle Realität: Der Interessenkonflikt war sichtbar, der Fokus lag auf der Ankunft und nicht auf der Leistung, und der Großteil der Berichterstattung nahm beides kommentarlos auf.

Der Chipmarkt für KI-Infrastruktur wird von Narrativen bewegt. Wenn Astra AGI ist, dann wird das, was Astra trainierte, zur Hardware der Post-AGI-Welt – und die Unternehmen, die Chips für den nächsten Trainingslauf kaufen, werden auf diesen Benchmark hin kaufen. Huangs Glückwünsche waren in diesem spezifischen Sinne auch eine Produktaussage. Die Aussage hing von einer Zahl ab, die die Benchmark-Organisation selbst anders gemessen hatte.

Was die unabhängige Überprüfung zeigt – und was nicht

Zum Zeitpunkt der Veröffentlichung taucht Astra weder im Artificial Analysis Intelligence Index noch in den Rankings von Arena.ai auf – den beiden meistbeachteten unabhängigen Bewertungssystemen für Grenzmodelle. Unabhängige Überprüfungen für große Grenzveröffentlichungen treffen in der Regel innerhalb von Tagen ein. Das Fehlen hier ist kein Beleg für schlechte Leistung. Es bedeutet, dass die externe Validierung, die normalerweise eine Behauptung dieser Größenordnung begleiten würde, noch nicht materialisiert ist.

Die 62,7% der Benchmark-Ersteller sind keine Widerlegung. Ein Ergebnis auf diesem Niveau bei ARC-AGI-3 – einem Test, der entwickelt wurde, um den Optimierungstricks zu widerstehen, die frühere Benchmarks aufgebläht haben – ist wirklich stark. Die Vorgänger von ARC-AGI-3 waren gesättigt: Modelle absorbierten Trainingsdaten, die den Testfragen ähnelten, und trieben die Zahlen in die Höhe, ohne sich bei neuartigem Denken zu verbessern. ARC-AGI-3 änderte das Fragendesign, um Abstraktion über Musterabruf zu erfordern. Zweiundsechzig Komma sieben Prozent bei diesem Test, unter dem Referenzrahmen, liegt weit über allem, was vor zwei Jahren existierte.

Die Forscher, die Einwände erhoben, waren diesbezüglich präzise. Die Fähigkeit des Modells war nicht ihr Ziel. Der Sprung von der Leistung zur Erklärung war es. „Schneidet bei diesen Benchmarks gut ab“ und „AGI ist angekommen“ erfordern einen Schritt dazwischen: eine stabile, vereinbarte Definition von AGI, an der die Ankunft gemessen werden kann. Es existiert keine solche Definition feldweit. OpenAI hat eine interne. Nach OpenAIs eigener Definition könnte Astra qualifizieren. Aber ein Unternehmen, das sein Produkt an einer selbst geschriebenen Definition misst, ist eine andere Art von Ergebnis als eines, das an einem externen Standard gemessen wird.

Der Satz, der ohne Definition kam

Huangs Post hatte keine Einschränkungen. „AGI ist angekommen“ ist ein deklarativer Satz – nicht „nach manchen Maßstäben“ oder „unter bestimmten Definitionen“, sondern eine klare Ankunft. Die von ihm genannte Vierjahresentwicklung – ChatGPT, o1, Astra – ist als Fähigkeitsverlauf real. Jedes Modell in der Sequenz erweiterte das Mögliche. Diese Sequenz als Reise mit einem Endpunkt zu rahmen und den Endpunkt zu verkünden, macht eine andere Behauptung: Sie sagt, dass Ankunft von der Reise unterscheidbar ist, dass es eine Linie und keine Steigung gibt, und dass Astra sie überschritten hat.

Die Benchmark-Zahl hinter dieser Behauptung war 62,7%. Die Leute, die den Test gebaut haben, veröffentlichten sie. Die Frage, die sie aufwirft – ob die AGI-Erklärung eine Messung oder eine Marktbewegung ist – war am 6. September da. Die Berichterstattung beantwortete sie weitgehend, ohne zu fragen.

Schlagwörter: , , , , ,

Diskussion

Es gibt 0 Kommentare.