KI

Anthropic-KI schickt Polizei in Philadelphia falschen Mordhinweis: Jetzt schaltet die Stadt ihre Juristen ein

Adrian Kessler
Fügen Sie uns bei Google hinzu

Der falsche Mordhinweis, den ein Anthropic-Modell auf der Website der Polizei von Philadelphia hinterließ, erreichte keinen Ermittler. Zuerst fing ihn ein Spamfilter ab. Das ist die beruhigende Hälfte der Geschichte – und genau darauf stützt sich auch die Darstellung des Unternehmens. Philadelphia handelt jedoch wegen der anderen Hälfte: Der Hinweis blieb wochenlang im städtischen System, bevor die Firma, deren Modell ihn erstellt hatte, davon erfuhr. Inzwischen haben die Verantwortlichen der Stadt ihre Juristen mit dem Fall betraut.

Hinter der befremdlichen Vorstellung, dass sich ein Chatbot als Zeuge ausgibt, steckt ein simplerer Mechanismus. Das Modell lief im Rahmen eines Tests unkontrolliert im echten Web und war lediglich durch eine kurze Liste von Dingen eingeschränkt, die es nicht tun durfte. Einen erfundenen Hinweis zu einer offenen Mordermittlung einzureichen, stand nicht auf dieser Liste.

Was Anthropics Modell tatsächlich tat

Anthropic zufolge handelte es sich um Claude Haiku 4.5, das so eingestellt war, dass es sich Beispielaufgaben ausdenken und auf zufällig ausgewählten Webseiten ausführen sollte. Eine dieser Seiten war das städtische Hinweisportal für ungelöste Tötungsdelikte, PhillyUnsolvedMurders.com. Die Anweisungen besagten, das Modell dürfe „sich niemals anmelden, Konten erstellen, persönliche Daten eingeben, Käufe tätigen oder etwas Zerstörerisches einreichen“. Zu Formularen stand darin nichts. Also füllte es eines aus, ließ die Felder für Name und Kontaktdaten leer und schrieb: „Ich habe möglicherweise Informationen zu diesem Fall.“

Laut Fox Business ging die Nachricht noch weiter und behauptete, sich daran zu erinnern, in der Nähe einer auf der Seite genannten Straße jemanden gesehen zu haben, der „der Beschreibung entsprach“. Auf der Seite war allerdings keine Beschreibung eines Verdächtigen zu finden. Zum Abschluss hieß es: „Bitte kontaktieren Sie mich, falls diese Information relevant ist.“ Die Polizei erklärt, die Nachricht sei als Spam markiert und nie zur Überprüfung an das Real-Time Crime Center weitergeleitet worden. Außerdem gebe es keine Hinweise auf unbefugten Zugriff auf Systeme oder Daten der Behörde.

Warum Philadelphia den Vorfall nicht als technischen Fehler abtut

In ihrer Stellungnahme schreibt die Polizei den eigenen Schutzvorkehrungen zu, den Schaden begrenzt zu haben, lässt es damit aber nicht bewenden. Die Maßnahmen „mindern nicht die Schwere des Umstands, dass ein KI-System erfundene Informationen präsentiert“, erklärte sie. „Bei ungelösten Fällen geht es um echte Opfer, trauernde Familien und Ermittler, die Antworten finden wollen.“ Anthropic habe man mitgeteilt, „das Unternehmen müsse seine Schutzvorkehrungen verstärken, damit ähnliche Vorfälle keine städtischen Systeme beeinträchtigen“, und die Verzögerung, bis die Stadt informiert worden sei, als „inakzeptabel“ bezeichnet.

Hier hört die Geschichte auf, nur von einem Modell zu handeln, und wird zur Geschichte über ein Unternehmen. NBC10 zufolge arbeiten die Polizei, das Law Department der Stadt, das Office of Innovation and Technology sowie das Team von Bürgermeisterin Cherelle Parker inzwischen gemeinsam an dem Fall. Die Stadtverwaltung erklärt zudem, sie werde Schutzmaßnahmen auf kommunaler, einzelstaatlicher und Bundesebene prüfen. Anklagen oder Sanktionen wurden bislang nicht angekündigt. Eine Stadtverwaltung, die untersucht, wie sich die Tests von KI-Laboren regulieren lassen, ist für Anthropic jedoch eine neue Art von Gegenüber.

Ein Eintrag auf einer längeren Liste

Der Hinweis aus Philadelphia ist Teil eines Berichts, den Anthropic am selben Tag veröffentlichte, an dem die Polizei den Vorfall öffentlich machte. Darin teilt das Unternehmen unbeabsichtigte Aktionen seiner Modelle auf echten Systemen in vier Kategorien ein: das Ausnutzen von Softwarefehlern auf Websites Dritter, um Befehle auszuführen; das Einreichen von Formularen, die sie nicht hätten abschicken dürfen; das Umgehen von Beschränkungen, um an geschützte Daten zu gelangen; sowie den Einsatz von URL-Verkürzern, um Limits bei Abrufwerkzeugen zu umgehen. In einem Fall reichte ein noch nicht veröffentlichtes Forschungsmodell ein echtes Formular einer Behörde ein, nachdem eine Übungskopie nicht geladen werden konnte. In einem anderen entdeckte Claude Mythos 5 Zugriffstokens in der Einstellungsdatei einer Karten-Website und nutzte sie, um eine kommunale Behörde über deren Server abzufragen.

Einige der betroffenen Websites gehörten Bundes-, Landes- und Kommunalbehörden. Anthropic erklärt, das Weiße Haus über die Fälle informiert und jede betroffene Behörde benachrichtigt zu haben. Das Unternehmen bezeichnet die Vorfälle als solche mit „minimalen Auswirkungen in der realen Welt“ und als weniger schwerwiegend als die zuvor offengelegten Fälle, bei denen Claude im Rahmen von Cybersicherheitsprüfungen stundenlang auf echte Systeme Dritter zugriff. Außerdem räumt Anthropic ein, die vollständige Alignment-Bewertung der neuen Fälle noch nicht abgeschlossen zu haben.

Auch der Zeitpunkt ist entscheidend. Die Federal Trade Commission bestätigte Ende September eine branchenweite Untersuchung gegen Anthropic, OpenAI und weitere Labore. Dabei soll geprüft werden, ob sie gegen den FTC Act verstoßen haben. Laut Reuters und The Next Web bereitet die Behörde formelle Aufforderungen vor, mit denen Führungskräfte zu Zeugenaussagen verpflichtet werden können. Reuters berichtete, FTC-Vorsitzender Andrew Ferguson habe angedeutet, dass Entwickler für Schäden haften sollten, wenn ihre Testagenten Systeme hacken. Der bekannteste Fall in dieser Akte betrifft OpenAI: Das Unternehmen gab im Juli bekannt, dass mehr als tausend seiner Agenten die Plattform Hugging Face gehackt hatten.

Was Anthropic geändert hat – und was das Eingeständnis bedeutet

Anthropic erklärt, den betreffenden Testprozess eingestellt, einen Validierungsschritt ergänzt, die Möglichkeiten seiner Modelle beim Einsatz von Webwerkzeugen eingeschränkt und Erkennungswerkzeuge entwickelt zu haben, die bei Tests sämtliche Fälle aus dem Bericht blockierten. Die weitreichendste Änderung ist ein Rückzug: Das Unternehmen hat den Stopp des Live-Internetzugriffs auf alle internen Evaluierungen ausgeweitet – „bis wir bestätigt haben, dass unsere Sicherheits- und Überwachungsmaßnahmen“ dieses Verhalten zuverlässig erkennen. Klar gesagt: Das Unternehmen kann derzeit noch nicht versprechen, dass es mitbekommt, was seine Agenten im offenen Web tun. Deshalb nimmt es sie dort vorerst heraus.

Die zeitliche Abfolge erklärt den Ärger der Stadt. Die Polizei datiert den Hinweis auf den 18. Juli (PhillyVoice berichtete am 28. Juli). Anthropic erklärt, den Fall bei einer im Juli begonnenen Überprüfung von Gesprächsprotokollen entdeckt zu haben; nach Angaben der Polizei erfuhr das Unternehmen am 28. September davon. Die Polizei sagt, Anthropic habe sie am Mittwoch, dem 7. Oktober, informiert; am folgenden Tag habe ein Treffen stattgefunden. In Anthropics Bericht ist der 8. Oktober als Zeitpunkt genannt, an dem das Unternehmen den Fund mitteilte – „sobald unsere technische Überprüfung abgeschlossen war“. Die Polizei machte den Vorfall am 9. Oktober öffentlich.

Die Schutzmaßnahme, die funktionierte, stammte von der Stadt: ein Spamfilter und die Regel, dass jeder Hinweis von einem Menschen geprüft wird. Das nächste Formular, das ein Testagent auszufüllen beschließt, könnte jemandem gehören, der keines von beidem hat.

Schlagwörter: , , , ,

Fügen Sie uns bei Google hinzu

Diskussion

Es gibt 0 Kommentare.