Microsoft Audio Grafik

Microsoft veröffentlicht drei Audiomodelle und Eins ist auf Rang 1

Andreas Becker GPT-Images-2.0
Microsoft Audio Grafik

Microsoft erweitert sein Angebot für Sprachverarbeitung um drei neue Modelle. MAI-Transcribe-2-Streaming führt direkt die Streaming-Rangliste von Artificial Analysis an. Mit MAI-Voice-2.1 und einer schnelleren Flash-Variante liefert der Konzern zugleich passende Stimmen für mehrsprachige Voice Agents.

Transkription beginnt schon während des Sprechens

MAI-Transcribe-2-Streaming erstellt Echtzeit-Transkripte in 60 Sprachen und erkennt dabei auch Sprachwechsel. Erste vorläufige Wörter erscheinen etwas mehr als 100 Millisekunden nach Eingang des Audios. Das Modell korrigiert diese Teiltranskripte mit wachsendem Kontext und legt anschließend eine stabile Fassung fest.

Im Streaming-Benchmark von Artificial Analysis erreicht es mit einer Wortfehlerrate von 2,5 Prozent den besten Wert der untersuchten Modelle. Auch bei den ersten Teiltranskripten liegt Microsoft vorn. Die Auswertung berücksichtigt rund acht Stunden Audiomaterial aus Gesprächen, Parlamentsaufnahmen und Unternehmenskonferenzen.

Quelle: Microsoft

Dadurch können Voice Agents bereits reagieren oder Funktionen aufrufen, bevor ein Nutzer seinen Satz beendet hat. Bei Diktaten und Untertiteln sollen Wörter doppelt so schnell erscheinen wie beim nächsten Konkurrenten. Bis zum Jahresende kostet die Verarbeitung einer Audiostunde 0,54 Dollar.

Quelle: Microsoft

Eine Stimme spricht 23 Sprachen

MAI-Voice-2.1 erzeugt Sprache in 23 Sprachen und 26 regionalen Varianten. Dieselbe geklonte Stimme kann zwischen Deutsch, Englisch oder Mandarin wechseln und dabei den jeweiligen Akzent übernehmen. Microsoft verlangt 22 Dollar je eine Million Zeichen.

Anzeige

MAI-Voice-2.1-Flash unterstützt dieselben Sprachen, richtet sich aber an große Mengen und Anwendungen mit geringer Wartezeit. Das Modell erzeugt 45 Sekunden Audio bei einer Ende-zu-Ende-Latenz von 150 Millisekunden. Die Berechnung läuft 55 Prozent schneller, der Preis liegt bei 15 Dollar je eine Million Zeichen.

Beide Sprachmodelle können aus wenigen Sekunden Referenzmaterial eine Stimme klonen. Eingebaute Einwilligungsprüfungen sollen Missbrauch verhindern. Die Modelle stehen unter anderem über Microsoft Foundry und den MAI Playground bereit, die beiden Voice-Varianten außerdem über OpenRouter.

Von Menschen für Menschen

Jeder Artikel entsteht durch menschliche Ideen und sorgfältige Prüfung. KI unterstützt uns vor allem bei Recherche und Feinschliff. Wir freuen uns über jede Unterstützung.

Jeder Beitrag zählt – auch das Teilen.