ElevenLabs veröffentlicht Echtzeit-Sprachmodell für interaktive Dialoge

ElevenLabs hat das Modell Eleven v3 Conversational allgemein verfügbar gemacht. Es generiert Sprache in Echtzeit und gibt Entwicklern über Audio-Tags detaillierte Kontrolle über die Emotionen der Stimmen.
Twitter Beitrag - Cookies links unten aktivieren.
Eleven v3 Conversational, our most expressive model for realtime speech, is now generally available.
— ElevenLabs (@ElevenLabs) August 19, 2026
For developers building voice experiences that respond with real emotion, Eleven v3 Conversational includes audio tags for fine-grained control and support across 70+ languages. pic.twitter.com/TOAkZt3qGa
Regieanweisungen für die KI-Stimme
Es richtet sich primär an Entwickler, die Kunden-Support-Bots oder Charaktere für Videospiele bauen. Statt Text lediglich monoton vorzulesen, verarbeitet das Modell emotionale Regieanweisungen. Über Audio-Tags lässt sich im Code steuern, ob die Stimme lacht, flüstert, sarkastisch klingt oder Neugier ausdrückt.
ElevenLabs hat die Architektur auf solche Echtzeit-Szenarien ausgelegt. Das Modell streamt Antworten ohne merkliche Verzögerung oder Qualitätsverlust. Dafür bietet das Unternehmen neue Text-to-Dialogue-Schnittstellen über WebSockets an. Deren Multi-Kontext-Verbindung verwaltet mehrere parallele Unterhaltungen.
Zugriff auf 11.000 Stimmen in über 70 Sprachen
Nutzer können für ihre Anwendungen auf eine Bibliothek von mehr als 11.000 Stimmen zugreifen. Eleven v3 Conversational unterstützt über 70 Sprachen. Laut ElevenLabs ist das Modell unter anderem für Deutsch, Spanisch, Französisch, Portugiesisch und Hindi optimiert.
Eleven v3 Conversational lässt sich über die Plattform ElevenAgents sowie die API von ElevenLabs in eigene Dienste integrieren. Die Kosten beginnen bei 0,05 US-Dollar pro 1000 generierten Zeichen. Bei größeren Abnahmemengen sinkt der Preis.
