KI

Anthropics Fable 5.1 senkt Cache-Kosten um 75% und mehr als verdoppelt agentische Benchmark-Werte

Susan Hill

Anthropic aktualisierte Claude am 1. September mit Fable 5.1 und senkte die Kosten für gecachte Eingabe-Tokens von 1,00 $ auf 0,25 $ pro Million – eine Reduzierung um 75 %, die genau zu dem Zeitpunkt kommt, an dem die meisten KI-Entwickler in der Produktion erkannt haben, dass sich ihre Infrastrukturbudgets tatsächlich auf die Kontextakkumulation konzentrieren, nicht auf die reine Rechenleistung. In einer Live-Agentik-Sitzung kann eine einzelne Claude-Unterhaltung Hunderttausende von Tokens im Cache halten, während sich der Kontext über mehrere Runden hinweg aufbaut. Bei 0,25 $ pro Million wird diese Akkumulation zu einer bewussten Designentscheidung und nicht zu einer Kostenobergrenze, um die der Entwickler herumarbeitet.

Die Benchmark-Ergebnisse, die die Preisänderung begleiten, zeigen Leistungssteigerungen, die den wirtschaftlichen Nutzen noch verstärken. Im Terminal-Bench-Science 0.1, der mehrstufiges wissenschaftliches Denken misst, das experimentelles Design und iterative Analyse erfordert, erzielte Fable 5.1 52,6 % gegenüber 24,7 % von Fable 5 – mehr als eine Verdopplung des vorherigen Ergebnisses. AutomationBench verbesserte sich von 17,1 % auf 31,4 %, und Terminal-Bench 4.0, eine breitere Bewertung der Agentik-Fähigkeiten, stieg von 42,0 % auf 55,8 %. CursorBench 3.2.0 erreichte 73,4 %. Das Muster über alle vier Bewertungen hinweg ist konsistent: Fable 5.1 ist nicht inkrementell besser am Rande, sondern wesentlich zuverlässiger in den Aufgabenkategorien, die den Wert von Agentik definieren.

Der kombinierte Effekt schreibt die Kostenarithmetik des Bauens mit Claude neu. Eine Agentik-Anwendung, die eine Aufgabe in weniger Runden abschließt – weil das Modell zuverlässiger ist – verbraucht auf dem Weg zu einem erfolgreichen Ergebnis insgesamt weniger Token-Zyklen. Wendet man die 75-prozentige Cache-Senkung auf die Tokens an, die sie tatsächlich verwendet, erreicht die effektive Kostensenkung pro Aufgabe in stark wiederverwendenden Agentik-Workflows 45 % oder mehr. Anthropic hat keine einzelne Schlagzahl für die kombinierten Einsparungen veröffentlicht, aber Entwickler, die ihre eigenen Token-Ökonomien modellieren, werden für kontextintensive Arbeitslasten auf Zahlen in dieser Größenordnung kommen.

Fable 5.1 ist sofort über die direkte API von Anthropic unter der Modellkennung claude-fable-5-1 sowie über Amazon Web Services Bedrock, Google Cloud Platform und Microsoft Azure verfügbar. Anthropic kündigte zeitgleich die Enterprise Frontier Safeguards an: kundenkontrollierte Datenaufbewahrung, kundenverwaltete Verschlüsselungsschlüssel und Bereitstellung innerhalb des bestehenden Cloud-Infrastruktur-Mandanten jedes Kunden – ohne zusätzliche Kosten über die zugrunde liegenden Cloud-Kosten hinaus.

Neben der allgemeinen Veröffentlichung führte Anthropic Mythos 5.1 ein, eine Variante desselben zugrunde liegenden Modells, die mit – wie das Unternehmen es beschreibt – großzügigeren Sicherheitsvorkehrungen für geprüfte Organisationen arbeitet. Der Zugang ist auf verifizierte Cybersicherheitsforschungseinrichtungen und Unternehmen der Life Sciences beschränkt. Das Unternehmen nannte demonstrierte Anwendungen, darunter Proteinbinder-Design und die Optimierung biologischer Modelle, mit einem bis zu 2,5-fachen Inferenzdurchsatz der Standardversion. Der Zugang zu Mythos 5.1 ist kein Self-Service: Anthropic prüft Anträge individuell und hat die Größe der eingeschriebenen Kohorte nicht veröffentlicht.

Die Agentik-Zahlen von Fable 5.1, insbesondere im Terminal-Bench-Science, bringen die veröffentlichten Ergebnisse von Anthropic vor die zuletzt von OpenAI offengelegten Zahlen in vergleichbaren Bewertungen. Vergleiche zwischen Unternehmen unterliegen methodischer Vorsicht – Anbieter wählen Bewertungen aus, die ihre Modelle begünstigen, und die spezifischen Tests, die Anthropic hervorgehoben hat, wurden vermutlich wegen ihrer günstigen Ergebnisse ausgewählt. Schwerer wegzuerklären ist das interne Verdopplungsmuster: Fable 5.1 ist nicht dasselbe Modell mit einer Preissenkung. Die Leistungsänderung ist groß genug, dass die Preisgeschichte und die Leistungsgeschichte nicht getrennt werden können.

Für Entwickler, die derzeit Claude nicht nutzen, ist die Cache-Preissenkung die Zahl, die es wert ist, in ihre eigene Token-Ökonomie übersetzt zu werden. Jeder KI-Anbieter, der nicht an 0,25 $ pro Million gecachter Tokens herankommt, wird sich nun in Unternehmensverkaufsgesprächen direkten Kostenvergleichen stellen müssen. Anthropics Cache-Preis war bereits vor dieser Senkung niedriger als der mehrerer Wettbewerber; die Lücke hat sich vergrößert. Leistungsverbesserungen sind über Anwendungsfälle hinweg schwerer zu verallgemeinern, aber im Bereich der Agentik und des wissenschaftlichen Denkens setzt Fable 5.1 ein Benchmark-Niveau, an dem die nächste große Veröffentlichung eines jeden Anbieters gemessen werden wird.

Schlagwörter: , , , ,

Diskussion

Es gibt 0 Kommentare.