KI

Ein 10-köpfiges Microsoft-Team hat ein Sprachmodell gebaut, das OpenAI, Google und ElevenLabs schlägt — für 0,10 $ pro Stunde

Adrian Kessler

Das Modell heißt MAI-Transcribe-2. Microsoft AI, die Abteilung unter der Leitung von Mustafa Suleyman, veröffentlichte es am 3. September zu einem Preis von 0,10 Dollar pro Audiostunde – begrenzt bis Ende 2026. Die Vorgängerversion MAI-Transcribe-1.5 kostete 0,36 Dollar pro Stunde. Diese 72-prozentige Preissenkung ist keine Marketing-Rundung. Ein Kontaktcenter, das 100.000 Audiostunden pro Jahr verarbeitet, zahlte für das vorherige Modell 36.000 Dollar; die gleiche Arbeitslast kostet jetzt 10.000 Dollar.

Die Benchmark-Leistung macht diesen Preis ungewöhnlich. In der mehrsprachigen FLEURS-Auswertung belegt MAI-Transcribe-2 den ersten Platz unter 60 Sprachen mit einer durchschnittlichen Wortfehlerrate von 5,2 % – besser als OpenAIs GPT-Transcribe, Googles Gemini 3.5 Transcribe, ElevenLabs Scribe v2 und Metas Whisper V3-Large. Im Artificial-Analysis-Ranking, das sowohl Genauigkeit als auch Latenz gemeinsam erfasst, liegt es auf dem zweiten Gesamtrang und definiert das, was die Forscher als Pareto-Grenze bezeichnen – die Grenze, jenseits derer man eine Kennzahl nicht verbessern kann, ohne die andere zu verschlechtern. Das Modell wurde darauf trainiert, am effizienten Rand dieser Grenze zu liegen, nicht die Spitze einer einzelnen Kennzahltabelle zu jagen.

Die Geschwindigkeit ist das zweite Anspruchsmerkmal, das einer Prüfung wert ist. Microsoft gibt an, dass MAI-Transcribe-2 Audio zehnmal schneller verarbeitet als GPT-Transcribe, siebenmal schneller als ElevenLabs Scribe v2 und fünfmal schneller als Gemini 3.5 Transcribe. Bei Langform-Audio – Podcast-Transkription, juristische Aussagen, klinische Notizen – entscheidet dieser Unterschied darüber, ob ein Arbeitsablauf in Sekunden oder Minuten läuft. Das Modell beherrscht auch Sprecherdiarisierung (Erkennung, wer wann gesprochen hat), Wortzeitstempel, Stichwortbeeinflussung für Fachterminologie und Code-Switching-Unterstützung für Sprachen, die mitten im Satz wechseln, wobei Hinglish und Spanglish als getestete Beispiele genannt werden.

Das Team, das es gebaut hat, ist bemerkenswert im Verhältnis zu dem, was es gebaut hat. Microsoft beschreibt die Kerngruppe als zehn Personen, die mit minimaler interner Bürokratie arbeiten und von größeren Teams unterstützt werden, die sich mit Datenerfassung und Lieferantenmanagement befassen. Die daraus resultierende Behauptung zur GPU-Effizienz ist konkret: MAI-Transcribe-2 läuft zur Hälfte der GPU-Kosten konkurrierender State-of-the-Art-Modelle. Ob das bei Unternehmenslast im großen Maßstab Bestand hat, ist aus der Ankündigung nicht überprüfbar, aber die Architekturbehauptung ist präzise genug, um getestet zu werden.

Das Modell ist jetzt auf Microsoft Foundry, dem MAI Playground und Open Router verfügbar – der Zugang erfordert also weder einen Azure-Vertrag noch eine Microsoft-Enterprise-Beziehung. Diese Vertriebsbreite ist bewusst gewählt. Der Vorstoß von Microsoft AI hin zu direkten Entwickler-APIs ist Teil einer breiteren Neupositionierung nach der Umstrukturierung der OpenAI-Partnerschaft. Änderungen im Oktober 2025 und April 2026 beseitigten die Exklusivitäts- und Umsatzbeteiligungsvereinbarungen, die die Beziehung seit 2019 geprägt hatten. Microsoft hat jetzt einen direkten Anreiz, auf der Modellebene zu konkurrieren, anstatt nur die Ergebnisse von OpenAI zu vertreiben.

Der Preis von 0,10 Dollar ist als bis Ende 2026 begrenzt gekennzeichnet. Standardpreise nach diesem Datum wurden nicht bekannt gegeben. Käufer, die MAI-Transcribe-2 für Produktionsworkloads evaluieren, kalkulieren ein Produkt, dessen Kosten sie für das Kalenderjahr 2027 nicht kennen. Das ist ein Risiko, das man klar benennen sollte, auch wenn der aktuelle Tarif das Modell im Vergleich zu jeder sichtbaren Alternative attraktiv macht.

Schlagwörter: , , , , ,

Diskussion

Es gibt 0 Kommentare.