Ein Wasserschwein mit Emotion

ElevenLabs veröffentlicht Echtzeit-Sprachmodell für interaktive Dialoge

Andreas Becker GPT-Images-2.0
Ein Wasserschwein mit Emotion

ElevenLabs hat das Modell Eleven v3 Conversational allgemein verfügbar gemacht. Es generiert Sprache in Echtzeit und gibt Entwicklern über Audio-Tags detaillierte Kontrolle über die Emotionen der Stimmen.

Twitter Beitrag - Cookies links unten aktivieren.

Regieanweisungen für die KI-Stimme

Es richtet sich primär an Entwickler, die Kunden-Support-Bots oder Charaktere für Videospiele bauen. Statt Text lediglich monoton vorzulesen, verarbeitet das Modell emotionale Regieanweisungen. Über Audio-Tags lässt sich im Code steuern, ob die Stimme lacht, flüstert, sarkastisch klingt oder Neugier ausdrückt.

ElevenLabs hat die Architektur auf solche Echtzeit-Szenarien ausgelegt. Das Modell streamt Antworten ohne merkliche Verzögerung oder Qualitätsverlust. Dafür bietet das Unternehmen neue Text-to-Dialogue-Schnittstellen über WebSockets an. Deren Multi-Kontext-Verbindung verwaltet mehrere parallele Unterhaltungen.

Zugriff auf 11.000 Stimmen in über 70 Sprachen

Nutzer können für ihre Anwendungen auf eine Bibliothek von mehr als 11.000 Stimmen zugreifen. Eleven v3 Conversational unterstützt über 70 Sprachen. Laut ElevenLabs ist das Modell unter anderem für Deutsch, Spanisch, Französisch, Portugiesisch und Hindi optimiert.

Eleven v3 Conversational lässt sich über die Plattform ElevenAgents sowie die API von ElevenLabs in eigene Dienste integrieren. Die Kosten beginnen bei 0,05 US-Dollar pro 1000 generierten Zeichen. Bei größeren Abnahmemengen sinkt der Preis.

Von Menschen für Menschen

Jeder Artikel entsteht durch menschliche Ideen und sorgfältige Prüfung. KI unterstützt uns vor allem bei Recherche und Feinschliff. Wir freuen uns über jede Unterstützung.

Jeder Beitrag zählt – auch das Teilen.