KI

Gemini 3.8 Live ersetzt das leere Gesicht im KI-Kundendienst

Adrian Kessler
Fügen Sie uns bei Google hinzu

Das System heißt Gemini 3.8 Live mit Live Avatar. Es kombiniert Googles Sprach-zu-Sprach-Modell mit einer Videoebene in Echtzeit, die Lippenbewegungen und Gesichtsausdrücke erzeugt, während im Hintergrund Tool-Aufrufe ausgeführt werden, ohne das Gespräch zu unterbrechen. Die Sprache wird automatisch erkannt – mitten im Gespräch wechselt der Avatar zwischen gesprochenen Sprachen, ohne Übergabe, erneutes Laden des Systems oder spürbare Pause.

Der Unterschied zu Verfahren mit Video-Overlays: Audio und Video werden im selben Inferenzprozess in Echtzeit erzeugt und nicht in aufeinanderfolgenden Schritten. Durch diese Kopplung bleibt die Latenz niedrig genug für einen natürlichen Gesprächsrhythmus. Google bettet unsichtbar SynthID-Wasserzeichen sowohl in die Audio- als auch in die Videoausgabe ein – jede Sekunde enthält eine maschinenlesbare Kennzeichnung, die den Inhalt als KI-generiert ausweist, selbst wenn der Stream später aufgezeichnet und wiedergegeben wird. Das Wasserzeichen bleibt auch nach einer erneuten Kodierung erhalten, sodass sich die Herkunft exportierter Clips weiterhin überprüfen lässt.

Wie sich das System im operativen Maßstab einsetzen lässt, zeigt am deutlichsten Equal AI, das Unternehmenseinsätze in ganz Indien betreut: Neun indische Sprachen sind gleichzeitig verfügbar, bei mehr als einer Million Live-Anrufen pro Tag und einer insgesamt unterstützten Spanne von 97 Sprachen. Eine solche Kapazität wäre mit menschlichen Mitarbeitenden bei vergleichbarer Verfügbarkeit und Schichtabdeckung wirtschaftlich kaum praktikabel. Die Annahme hinter dem Einsatz ist nicht ein Machbarkeitsnachweis – entscheidend ist der Durchsatz.

Was Google zum Start nicht verrät, ist der Preis. Das Unternehmen hat keine Kosten veröffentlicht und verweist Anfragen an sein Enterprise-Vertriebsteam. Die Erstellung individueller Avatare – also eines Gesichts auf Basis eigener Referenzbilder – setzt eine Freischaltung für Unternehmen voraus, die ein separates Prüfverfahren erfordert und nicht im Self-Service möglich ist. Die Extended-Thinking-Funktionen des Live-Modells befinden sich weiterhin in einer privaten Vorschau; damit ist die Tiefe der Schlussfolgerungen im Vergleich zu anderen Gemini-Angeboten von Google begrenzt. Angaben zu den Obergrenzen für parallele Sitzungen fehlen ebenfalls. Das eingeschränkte Startprofil entspricht Googles Vorgehen bei gestaffelten Enterprise-Einführungen, bei denen Preise und Kapazitäten ausgehandelt statt veröffentlicht werden.

Gemini 3.8 Live mit Live Avatar ist ab sofort in der Gemini Enterprise Console und über die Live API verfügbar, mit Endpunkten in den Vereinigten Staaten und der Europäischen Union. Für Extended Thinking im Live-Modell gibt es über die aktuelle Gruppe in der privaten Vorschau hinaus keinen veröffentlichten Zeitplan für einen breiteren Zugang.

Die Unternehmen, die das System einsetzen, werden eine Frage beantworten müssen, auf die die Technologie selbst keine Antwort gibt: Verbessert es das Nutzererlebnis, wenn das visuelle Signal verschwindet, an dem sich eine automatisierte Interaktion erkennen lässt – oder nimmt es den Nutzenden den letzten ehrlichen Hinweis darauf, dass sie gerade eine solche erleben?

Schlagwörter: , , , , ,

Fügen Sie uns bei Google hinzu

Diskussion

Es gibt 0 Kommentare.