Googles Sprach-KI Gemini 3.8 Live kann Gespräche künftig mit einem animierten Gesicht führen. Die neue Funktion Live Avatar erzeugt während des Dialogs ein Videobild, dessen Lippenbewegungen und Mimik zur gesprochenen Antwort passen.
Der Avatar hört zu, kann Kamerabilder des Nutzers einbeziehen und reagiert auf Unterbrechungen. Google richtet das Angebot an Unternehmen, die damit etwa Kundenservice oder interaktive Anleitungen gestalten wollen.
Quelle: Google
Reden, sehen und nebenbei Daten abrufen
Live Avatar verbindet die bereits vorgestellte Gesprächsfunktion von Gemini 3.8 Live jetzt mit einem Avatar. Nutzer sprechen mit einer sichtbaren Figur, statt nur eine Stimme zu hören. In Googles Beispielen tritt der Avatar mit unterschiedlichen Stimmen und Erscheinungsbildern auf. Wie natürlich das im Alltag wirkt, muss sich außerhalb der Vorführungen zeigen.
Während des Gesprächs kann Gemini im Hintergrund externe Funktionen aufrufen und Informationen abrufen. Google demonstriert das am Check-in eines Hotelgasts. Der Avatar spricht weiter, während die nötigen Daten abgefragt werden. Er kann außerdem gleichzeitig auf Sprache und Kamerabilder reagieren, etwa wenn ein Nutzer ihm etwas zeigt und dazu eine Frage stellt.
Anzeige
Eigene Figuren nur mit Sonderzugang
Unternehmen können vorgefertigte Avatare auswählen. Eine eigene Figur lässt sich aus einem Referenzbild erzeugen, doch diese Möglichkeit steht derzeit nur ausgewählten Unternehmenskunden offen. Google nennt für Live Avatar 97 unterstützte Sprachen. Auch bei einem Sprachwechsel mitten im Gespräch sollen Lippenbewegungen und Mimik zur Ausgabe passen.
Die erzeugten Audio- und Videoinhalte versieht Google mit dem unsichtbaren Wasserzeichen SynthID. So sollen sich KI-generierte Aufnahmen später erkennen lassen. Live Avatar ist über die Gemini Enterprise Agent Platform und deren Live API verfügbar. Für die Nutzung eigener Avatare verlangt Google die nötigen Rechte und Einwilligungen für die verwendeten Gesichts- oder Stimmaufnahmen.