KI

ElevenLabs v4 braucht 10 Sekunden Ihrer Stimme, um sie 90 Sprachen sprechen zu lassen

Susan Hill
Fügen Sie uns bei Google hinzu

ElevenLabs hat Eleven v4 veröffentlicht: ein Text-to-Speech-Modell, das geschriebene Texte mit einem Lachen, einem Seufzer oder einem wütenden französischen Akzent vorliest – ganz so, wie der Autor es vorgibt. Für das sofortige Klonen einer Stimme genügt eine Aufnahme, die kürzer ist als eine Sprachnachricht auf der Mailbox. Anschließend kann die geklonte Stimme Dutzende Sprachen sprechen und dabei ihren eigenen Klang behalten. Nutzen kann das Modell jeder mit einem kostenlosen ElevenLabs-Konto.

Für alle, die mit Audio arbeiten, bedeutet das: ganze Arbeitstage fallen weg. Ein Podcaster kann eine Folge mit der eigenen Stimme auf Japanisch synchronisieren, ein Indie-Spieleentwickler jeder Nebenfigur eine unverwechselbare Sprechweise geben, ohne ein Studio zu buchen, und eine Hörbuchsprecherin kann Pausen oder ein Kichern direkt ins Skript schreiben. Die Kehrseite ist ebenso greifbar: Eine Sprachnachricht, ein Ausschnitt aus einem Videoanruf oder ein paar Sekunden aus einem öffentlichen Post reichen jetzt als Ausgangsmaterial für eine überzeugende Stimmkopie.

Die wichtigste Neuerung ist die Kontrolle – und für den Klon selbst genügen gerade einmal zehn Sekunden Audio. Frühere ElevenLabs-Modelle lasen Texte klar vor, mussten die jeweilige Stimmung aber erraten. Version 4 versteht Regieanweisungen in eckigen Klammern, etwa [lacht] oder [wütend mit französischem Akzent gesprochen], und sogar Hinweise auf Hintergrundgeräusche wie [leichter Regen] oder [Telefon vibriert]. Laut Unternehmen erkennt das Modell Tonfall und Sprechtempo auch aus dem Kontext, sodass eine Zeile in einer spannungsgeladenen Szene angespannt klingt, ohne dass eine entsprechende Anweisung nötig ist. In Szenen mit mehreren Sprechern bleibt die Stimme jeder Figur auch über längere Passagen hinweg konsistent. Das war eine Schwachstelle synthetischer Erzählstimmen, die im Verlauf eines Kapitels oft immer weiter abwichen.

Die Zahl der unterstützten Sprachen steigt von 70 in der Vorgängerversion auf mehr als 90. Besonders große Qualitätsverbesserungen hebt ElevenLabs für Japanisch, brasilianisches Portugiesisch, Mandarin und Kantonesisch hervor, berichtet TechCrunch. Eine geklonte Stimme bleibt auch beim Sprachwechsel wiedererkennbar: Liest der Klon einer spanischsprachigen Person einen deutschen Text, klingt er weiterhin nach dieser Person – mit einem muttersprachlich deutschen Akzent. Ein zweites Modell, v4 Turbo, ist für Sprachassistenten und Callcenter-Agenten gedacht. Es beginnt nach etwa 150 Millisekunden zu sprechen – ungefähr so lange, wie zwei Menschen beim Wechsel in einem Gespräch innehalten. Dabei kann es schon loslegen, bevor der dahinterliegende Chatbot seine Antwort fertig formuliert hat.

ElevenLabs ist auf diesem Markt nicht allein. Google, OpenAI, Cartesia, Deepgram und Fish Audio bieten Entwicklern ebenfalls synthetische Stimmen an. Nur wenige Stunden nach der Veröffentlichung setzte das unabhängige Benchmarking-Unternehmen Artificial Analysis v4 an die Spitze seiner Stimmen-Rangliste, in der Zuhörer anonyme Beispiele direkt miteinander vergleichen. ElevenLabs erklärt außerdem, dass in Blindvergleichen mit Konkurrenzprodukten etwa drei von vier Zuhörern v4 bevorzugten – eine Zahl aus unternehmenseigenen Tests.

Die Einschränkungen beginnen schon bei den zehn Sekunden. ElevenLabs zufolge dürfen Stimmen nur mit Zustimmung der betreffenden Person geklont werden. Das Unternehmen betreibt einen öffentlich zugänglichen Klassifikator, der mit seinen Tools erzeugte Audiosignale erkennen kann, und blockiert Klone bestimmter politischer Persönlichkeiten grundsätzlich. Solche Prüfungen erschweren den beiläufigen Missbrauch, setzen aber voraus, dass die Person, die eine Stimme hochlädt, die Wahrheit sagt. Ein Betrüger braucht nur eine kurze Stimmprobe eines Angehörigen, um einen fingierten Notfallanruf aufzusetzen. Auch das kostenlose Angebot ist begrenzt: Laut der Tarifübersicht von Unite.AI umfasst es etwa zehn Minuten erzeugtes Audio pro Monat; kostenpflichtige Tarife beginnen bei sechs Dollar monatlich.

Eleven v4 und v4 Turbo gingen am 28. September in der Creator-App von ElevenLabs, auf der Agentenplattform des Unternehmens und über dessen Entwickler-API an den Start. Das in London ansässige Unternehmen nahm im Februar 500 Millionen Dollar von Sequoia auf, bei einer Bewertung von elf Milliarden Dollar. TechCrunch berichtet, dass der annualisierte Umsatz inzwischen mehr als 600 Millionen Dollar beträgt. Geschäftsführer Mati Staniszewski sagte TechCrunch, das Unternehmen strebe in den kommenden Jahren einen Börsengang an, ohne sich auf einen Zeitpunkt festzulegen.

Für Kreative ist eine Stimme, die auf Kommando in 90 Sprachen lacht, ein Tonstudio im Browser-Tab. Für alle anderen ist sie ein weiterer Grund, aufzulegen und zurückzurufen, wenn eine vertraute Stimme am Telefon um Geld bittet.

Schlagwörter: , , , , ,

Fügen Sie uns bei Google hinzu

Diskussion

Es gibt 0 Kommentare.