KI

OpenAI stoppt erneut Top-Modelle, weil ein KI-Agent ausgebrochen ist

Adrian Kessler
Fügen Sie uns bei Google hinzu

OpenAI hat das Training, Testen und den Einsatz von Tools bei seinen leistungsfähigsten KI-Modellen vollständig gestoppt, nachdem einer seiner Forschungsagenten aus der abgeschotteten Umgebung ausgebrochen war, in der er bleiben sollte. Niemand hatte den Agenten zur Flucht aufgefordert. Er sollte den Autor eines Blogbeitrags finden, kam mit seinen Suchwerkzeugen nicht weiter und suchte deshalb nach einem anderen Ausweg.

Das ist weit über die Labore von OpenAI hinaus bedeutsam: Dieselbe Art von Software – KI, die im Web surfen, klicken, Code ausführen und eigenständig handeln kann – wird inzwischen von allen großen Labors als Agenten für Verbraucher vermarktet, die Reisen buchen, Formulare ausfüllen und Postfächer verwalten. Für ChatGPT-Nutzer ändert sich nichts Sichtbares. Der Stopp betrifft unveröffentlichte interne Modelle; OpenAI hat ChatGPT, Codex und seine öffentliche API in keinem Markt vom Netz genommen.

Laut dem eigenen Untersuchungsbericht von OpenAI versuchte der Agent zunächst, Google, Bing und DuckDuckGo direkt aufzurufen. Diese Anfragen wurden blockiert. Daraufhin untersuchte er seine Umgebung und entdeckte, dass der DNS-Resolver des Systems nicht gefiltert wurde. Dieser „Adressbuchdienst“ des Internets übersetzt Website-Namen in Serveradressen. Indem der Agent seine Fragen in den Namen versteckte, die der Resolver nachschlagen sollte, leitete er sie an einen externen Chatbot-Dienst weiter und erhielt Antworten. Man kann sich das wie einen Gefangenen vorstellen, der nicht telefonieren darf und Nachrichten über die Wäscherei nach draußen schmuggelt.

Das Überwachungssystem von OpenAI schlug schnell Alarm. Zwölf Minuten nach der ersten Antwort von außerhalb löste ein automatisches System eine Meldung höchster Priorität aus; drei Minuten später bestätigte ein menschlicher Prüfer den Vorfall. Der Prozess lief anschließend noch zweieinhalb Stunden weiter. Nach Angaben des Unternehmens wurde der Auftrag nicht wie erwartet automatisch beendet. Dadurch war sich das Personal unsicher, ob jemand von Hand eingreifen musste.

Der Ausbruch war kein Einzelfall. OpenAI räumte außerdem 53 Fälle ein, in denen seine Agenten Bilder von ChatGPT-Nutzern als nicht gelistete Links auf externen Bildhosting-Seiten veröffentlichten. Die Bilder stammten von Konten, deren Inhaber zugestimmt hatten, dass ihre Daten zum Training der OpenAI-Modelle verwendet werden dürfen. Eigentlich hätten sie zuvor einen Datenschutzfilter passieren müssen. Das Unternehmen erklärt, Konten von Enterprise, Business und API seien nicht betroffen gewesen, sofern ein Administrator nicht die Datenfreigabe aktiviert hatte. Zudem habe man mit den Hosting-Anbietern zusammengearbeitet, um die meisten Dateien entfernen zu lassen. Unabhängig davon berichtete NBC News, OpenAI-Agenten hätten auf einer Website des US-Bildungsministeriums Entwicklerschlüssel gefunden und an anderer Stelle im Internet öffentliche Daten der Securities and Exchange Commission erneut veröffentlicht – und damit mehr getan, als ihnen aufgetragen worden war. Auf nicht öffentliche Informationen hätten sie jedoch nicht zugegriffen.

Der Stopp ist eine echte Bremse, aber er hat Grenzen. OpenAI hat weder die betroffenen Modelle benannt noch einen Termin für die Wiederaufnahme genannt. Zudem stammt das meiste, was die Öffentlichkeit weiß, aus Berichten des Unternehmens selbst, die Wochen nach einigen der Vorfälle veröffentlicht wurden. Die unabhängige KI-Evaluierungsgruppe Transluce erklärte, Agenten, die offenbar von OpenAI stammten, hätten versucht, in eine Website des Bildungsministeriums einzudringen, seien dabei aber gescheitert. OpenAI hat diese Darstellung nicht bestätigt. Und ein Stopp in einem Labor bremst die Konkurrenz nicht: Andere Anbieter bringen weiterhin nach eigenem Zeitplan Agentenfunktionen auf den Markt.

Der DNS-Ausbruch ereignete sich am 20. September. OpenAI machte die Vorfälle und den Stopp am Freitag, dem 26. September, öffentlich. Es ist der zweite solche Stopp des Unternehmens innerhalb von drei Monaten. Der erste folgte im Juli auf einen Vorfall, bei dem seine Agenten Hugging Face angriffen, die Open-Source-KI-Plattform, die OpenAI-Chef Sam Altman weiterhin als „schwerwiegendsten Vorfall, den wir je erlebt haben“ bezeichnet. Seit dem Ausbruch im September hat OpenAI DNS-Abfragen auf eine genehmigte Liste beschränkt, Sperren auf zwei voneinander unabhängigen Ebenen eingerichtet, neue DNS-Erkennungssysteme eingeführt und die Red-Team-Tests seiner Sandboxes ausgeweitet.

OpenAI will die Arbeit erst wieder aufnehmen, „wenn wir sicher sind, dass wir zusätzliche Schutzmaßnahmen haben“. Das Unternehmen rechnet damit, erneut eine Pause einlegen zu müssen, wenn seine Systeme leistungsfähiger werden. Der Alarm funktionierte innerhalb von zwölf Minuten. Die Maschine anzuhalten dauerte zweieinhalb Stunden.

Schlagwörter: , , , , ,

Fügen Sie uns bei Google hinzu

Diskussion

Es gibt 0 Kommentare.