Synthetische Stimmen klangen jahrelang vor allem nach einem: nach mechanischem Vorlesen. Selbst moderne Sprachmodelle verrieten sich bisher regelmäßig durch starre Satzmelodien, monotone Betonungen oder unpassende emotionale Brüche. Mit der Freigabe von Eleven v4 und der latenzoptimierten Variante Eleven v4 Turbo schlägt das KI-Audio-Unternehmen ElevenLabs ein neues Kapitel auf. Das System soll Skripte nicht mehr nur abarbeiten, sondern wie ein ausgebildeter Sprecher interpretieren - inklusive Tonfall, Timing, Atempausen und situativer Regieanweisungen. Zeitgleich rollt der Anbieter mit Studio 4.0 eine runderneuerte Produktionsumgebung aus, in der ein agentischer KI-Co-Editor Video-, Sprach- und Musikelemente auf einer gemeinsamen Zeitleiste arrangiert.
Architektur-Wechsel: Wenn KI-Stimmen den Subtext verstehen
Nach Angaben der ElevenLabs-Gründer Mati Staniszewski und Piotr Dabkowski basiert Eleven v4 auf einer vollständig überarbeiteten Modellarchitektur. Während frühere Generationen geschriebene Sätze vor allem phonetisch in Klangfolgen übersetzten, wertet das neue Modell den erzählerischen Gesamtkontext einer Szene aus. Das Stimmmodell soll erkennen, ob eine Zeile wie „Ich brauche jetzt deine volle Aufmerksamkeit" von einem Notarzt im Schockraum sanft und beruhigend oder von einem Videospiel-Charakter hektisch ins Funkgerät gerufen wird.
Die Regieführung erfolgt wahlweise über natürliche Textanweisungen oder strukturierte Audio-Tags in eckigen Klammern. Befehle wie [whispers], [laughs] oder [said angrily in French accent] lassen sich laut offiziellem Ankündigungsblog von ElevenLabs präziser und sogar mehrfach gestapelt innerhalb eines einzelnen Satzes platzieren. Gegenüber dem Vorgänger Eleven v3, der ähnliche Steuerungen einführte, aber häufig inkonsistent ausführte, folge v4 solchen Regieanweisungen deutlich zuverlässiger. Ähnlich wie bei Googles Vorstoß mit Gemini Flash TTS und Audio-Tags können Entwickler und Kreative das Verhalten des Modells gezielt steuern.
Für technische Begriffe, Fachtermini oder seltene Eigennamen wurde zudem die Unterstützung für Lautschrift nach dem Internationalen Phonetischen Alphabet (IPA) ausgebaut. Pro Einzelanfrage verarbeitet das Flaggschiffmodell bis zu 10.000 Zeichen - was rund zehn Minuten zusammenhängendem Audio entspricht. Ein zentrales Problem bei Hörbuch- und Podcast-Produktionen adressiert das sogenannte Kontext-Stitching: Müssen einzelne Sätze in einem langen Kapitel nachträglich neu generiert werden, analysiert das Modell nun die vorhergehenden und nachfolgenden Absätze, damit Sprechtempo und Klangfarbe exakt in die Aufnahme passen.
Stimmklone und Mehrsprachigkeit: Zehn Sekunden genügen
Erhebliche Fortschritte meldet ElevenLabs bei der Stimmklonung. Für einen einfachen Stimmklon (Instant Voice Clone) genügen nach Unternehmensangaben künftig zehn Sekunden sauberes Ausgangsmaterial. Das Modell soll die wesentlichen Stimmmerkmale sofort erfassen und dauerhaft reproduzieren. Bei professionellen Stimmklonen (Professional Voice Clones, PVC) müssen Bestandskunden ihre hinterlegten Stimmen über das Einstellungsmenü allerdings einmalig auf die v4-Architektur nachtrainieren, um die neuen Fähigkeiten freizuschalten.
Beide Modellvarianten unterstützen mehr als 90 Sprachen - beim Vorgänger waren es noch rund 70. Nach Herstellerangaben wurden die größten Qualitätssprünge in Japanisch, brasilianischem Portugiesisch, Mandarin und Kantonesisch erzielt. Bemerkenswert ist die Akzenttreue bei der Lokalisierung: Eine in deutscher Sprache aufgenommene Stimme soll bei der Übersetzung in andere Sprachen den jeweiligen landestypischen Akzent fließend annehmen, ohne ihre wiedererkennbare Stimmidentität zu verlieren oder während längerer Passagen in den Ausgangsakzent zurückzugleiten. Dies baut direkt auf den Werkzeugen auf, die das Unternehmen bereits für die automatisierte Mehrsprachen-Lokalisierung entwickelt hat.
Eleven v4 Turbo: Sub-Sekunden-Reaktion für Telefon-Agenten
Für Entwickler interaktiver Sprachsysteme brachte der Spagat zwischen Ausdruckskraft und Latenz bisher harte Kompromisse mit sich: Wer menschenähnliche Betonungen wollte, musste unnatürlich lange Sprechpausen hinnehmen; wer schnelle Antworten brauchte, landete bei monotonen Hotline-Robotern. Mit Eleven v4 Turbo will das Unternehmen diesen Zielkonflikt auflösen.
Nach Herstellerangaben erreicht die Turbo-Variante eine mittlere Inferenz-Latenz von etwa 100 Millisekunden. Die gemessene Zeitspanne vom Absenden der Anfrage bis zur ersten hörbaren Sprachausgabe (Time to First Speech) beziffert das Unternehmen beim Streaming über WebSockets auf rund 150 Millisekunden. In internen Benchmark-Vergleichen von ElevenLabs lag Cartesia Sonic 3.6 bei 262 Millisekunden und OpenAIs GPT-4o mini TTS bei 814 Millisekunden. Über bidirektionales Input-Streaming können externe Sprachmodelle (LLMs) erzeugte Textfragmente direkt an die Sprach-Engine übergeben, während diese bereits mit der Audiowiedergabe beginnt.
Die Turbo-Variante ist eng mit der Plattform ElevenAgents verzahnt, auf der Firmen schlüsselfertige Telefon-Assistenten wie Reception.ai für Unternehmenszentralen aufsetzen. Im Anbieter-Ranking der Analyseplattform Artificial Analysis belegt Eleven v4 im September 2026 den ersten Platz im „Provider Voice Arena Leaderboard". In herstellereigenen Doppelblindtests hätten rund 75 Prozent der Testteilnehmer die Ausgabe von Eleven v4 gegenüber Wettbewerbern wie Cartesia, Inworld und Googles Gemini TTS bevorzugt.
| Modell / Plattform | Primärer Fokus | Latenz / TTFS | Sprachen | Preis pro 1M Zeichen |
|---|---|---|---|---|
| Eleven v4 | Hörbücher, Voiceover, Dubbing, Schauspiel | Standard (Inferenz-optimiert) | 90+ Sprachen | 80 USD (Aktion: 22 USD) |
| Eleven v4 Turbo | Echtzeit-Sprachagenten, Callcenter, Bots | ~100 ms Latenz / ~150 ms TTFS | 90+ Sprachen | 40 USD (Aktion: 11 USD) |
| Cartesia Sonic 3.6 | Echtzeit-Sprachsynthese für Agenten | ~262 ms TTFS | Ausgewählte Sprachen | 49 USD |
| Gemini 3.8 Flash TTS | Skalierbare Audio-Inferenz im Ökosystem | Niedrige Latenz | Mehrsprachig | 16,49 USD |
Studio 4.0: Agentischer Editor rückt Bild, Ton und Text zusammen
Parallel zu den Modellen aktualisiert ElevenLabs seine Weboberfläche mit dem Start von Studio 4.0. Die Anwendung baut auf der im Frühjahr vorgestellten Produktionssuite ElevenCreative auf und wandelt sich von einem reinen Stimmgenerator zu einem vollwertigen Kreativ-Editor für Audio- und Videoprojekte.
Herzstück ist der sogenannte Studio Agent. Nutzer können ihr Vorhaben in natürlicher Sprache schildern, woraufhin der Assistent ein erstes Skript entwirft, passende Stimmen auswählt, Geräuscheffekte (Sound FX) platziert und Audioelemente mit hochgeladenen MP4- oder MOV-Videodateien auf einer gemeinsamen Zeitleiste synchronisiert. Produzenten können jederzeit manuell eingreifen oder einzelne Sequenzen bildgenau nachjustieren.
Mit der Funktion „Speech Correction" lassen sich Versprecher in vorhandenen Aufnahmen unmittelbar über das Skript korrigieren. Ändert der Nutzer ein Wort im Text, regeneriert das System die entsprechende Stelle in derselben geklonten Stimme, ohne dass die gesamte Tonspur neu eingespielt werden muss. Ein integrierter Voice Isolator filtert Raumhall und Hintergrundlärm heraus, während das hauseigene Modell Eleven Music passende Hintergrundmusik zur jeweiligen Szene generiert.
Marktkontext und Risikofaktoren
Druck auf Synchronsprecher: Die Fähigkeit von v4, schauspielerische Nuancen, Lachen, Seufzen und Akzente über 90 Sprachen hinweg nachzubilden, verschärft die Debatte um den Schutz professioneller Sprecher. Während ElevenLabs auf Lizenzvergütungen für verifizierte Marktplatz-Stimmen setzt, fehlen in vielen internationalen Märkten verbindliche Tarif- und Schutzregeln gegen den ungefragten Stimmersatz.
Gefahr durch Audio-Deepfakes: Klonungen auf Basis von lediglich zehn Sekunden Audiomaterial senken die Einstiegshürde für gezielte Betrugsversuche am Telefon (CEO-Fraud) und manipulative Falschmeldungen. Untersuchungen von Organisationen wie NewsGuard belegten bereits mehrfach, wie anfällig Echtzeit-Audiosysteme für suggestive Desinformation sein können.
Datenschutz und EU-Residency: Laut Bericht von The Decoder speichert ElevenLabs Kundendaten standardmäßig in US-Rechenzentren. Eine isolierte Datenspeicherung innerhalb der Europäischen Union steht bislang nur Unternehmenskunden im Enterprise-Tarif oder über zustandslose API-Aufrufe ohne Speicherung zur Verfügung.
Regulär schlägt Eleven v4 über die Programmierschnittstelle mit 80 US-Dollar pro Million Zeichen zu Buche, während Eleven v4 Turbo mit 40 Dollar bepreist ist. Bis zum 12. Oktober bietet der Anbieter eine Einführungsaktion mit 22 beziehungsweise 11 Dollar an. Beide Modelle sind ab sofort in ElevenCreative, ElevenAgents und über die API freigeschaltet.
🎯 Was das für die Praxis bedeutet
1. Audio-Content per Regie-Tag steuern: Wer Skripte für Hörbücher, Erklärvideos oder Podcasts einsetzt, sollte emotionale Anweisungen wie Flüstern oder Lachen direkt als Inline-Tags im Fließtext ausprobieren.
2. Professionelle Stimmklone manuell aktualisieren: Eigene Professional Voice Clones (PVC) nutzen v4 nicht automatisch. Das Finetuning auf das neue Modell muss in den Kontoeinstellungen aktiv angestoßen werden.
3. Sprachagenten mit Turbo-Option evaluieren: Für Support-Hotlines und Telefon-Bots bietet v4 Turbo die bisher stärkste Kombination aus niedriger Latenz (ca. 150 ms TTFS) und natürlicher Satzmodulation.
4. Compliance und Serverstandorte beachten: Unternehmen in Deutschland und Österreich müssen bei Kundendaten auf die US-Verarbeitung achten und bei sensiblen Projekten Enterprise-Optionen oder die zustandslose Zero-Retention-API wählen.



