Ein Gemini 3.8 Voice Illustration

Gemini 3.8 Live spricht, während es Aufgaben erledigt

Andreas Becker GPT-Images-2.0
Ein Gemini 3.8 Voice Illustration

Google erweitert seine Gemini-Familie um zwei neue Live-Sprachmodelle. Gemini 3.8 Live ist auf hohe Nutzerzahlen und niedrige Kosten ausgelegt. Gemini 3.8 Live Extended Thinking übernimmt komplexere Aufgaben und plant mehrere Schritte. Beide verarbeiten Sprache in nahezu Echtzeit und richten sich vor allem an Voice-Agenten.

Zwei Modelle für Gespräche und Aufgaben

Die Basisversion kann visuelle Eingaben laufend in das Gespräch einbeziehen. Sie erkennt 97 Sprachen und wechselt innerhalb einer Unterhaltung automatisch zwischen ihnen. Tool- und API-Aufrufe laufen im Hintergrund, während das Modell weiter mit dem Nutzer spricht.

Extended Thinking verbindet längeres Reasoning mit fortlaufender Sprachausgabe. Das Modell quittiert Aufgaben früh, meldet Zwischenschritte und hält den Dialog offen, während es etwa Buchungen koordiniert oder aus Skizzen React-Komponenten erstellt.

Anzeige

Extended Thinking liegt in drei Benchmarks vorn

Im Speech to Speech Index erreicht die Variante mit Extended Thinking 82,6 Prozent. GPT-Live-1 Astra folgt mit 81,5 Prozent, Grok Voice Think Fast 2.0 mit 81,3 Prozent. Ohne Extended Thinking sind es immer noch gute 76%.

Quelle: Google

Beim agentischen τ-Voice-Test liegt Googles Modell mit 68,6 Prozent ebenfalls knapp vor GPT-Live-1 Astra mit 67,9 Prozent. Im τ³-Banking-Leaderboard von Sierra fällt der Vorsprung noch deutlicher aus. Extended Thinking kommt auf 35,1 Prozent, Astra auf 32,0 Prozent und xAI Realtime auf 16,5 Prozent.

Quelle: Google

Die günstigere Variante kostet 84 Cent pro Stunde

Gemini 3.8 Live kostet 0,84 Dollar pro Stunde Eingangsaudio im Big-Bench-Audio-Subset. Extended Thinking High liegt bei 3,50 Dollar. Grok Voice Think Fast 2.0 High kostet 4,80 Dollar, GPT-Live-1 Astra Medium 5,83 Dollar. Die Grafik vergleicht damit nur Eingangsaudio, nicht sämtliche Betriebskosten eines Voice-Agenten.

Unterm Strich ist Google mit seinen neuen Modellen entweder besser oder günstiger oder auch Beides.

Quelle: Google

Start in API, Search und Workspace

Beide Modelle starten heute über die Gemini API und Google AI Studio. Gemini 3.8 Live kommt zudem in Search Live. Extended Thinking erreicht Gemini Live sowie zahlende Nutzer in Docs, Gmail und Keep.

Google versieht alle von seinen KI-Produkten erzeugten Audioausgaben mit SynthID. Das nicht hörbare Wasserzeichen soll KI-Audio erkennbar machen.

Von Menschen für Menschen

Jeder Artikel entsteht durch menschliche Ideen und sorgfältige Prüfung. KI unterstützt uns vor allem bei Recherche und Feinschliff. Wir freuen uns über jede Unterstützung.

Jeder Beitrag zählt – auch das Teilen.