Meta hat mit Muse Voice Transcribe ein neues Audio-Modell für Echtzeit-Transkriptionen veröffentlicht. Laut CEO Mark Zuckerberg belegt es derzeit den ersten Platz in unabhängigen Benchmarks und ist bereits in ersten Anwendungen verfügbar.
Twitter Beitrag - Cookies links unten aktivieren.
Muse Voice Transcribe is MSL's first real-time audio perception model -- rolling out today. SOTA in streaming speech-to-text, it handles speaker diarization, and endpointing natively in a single model. pic.twitter.com/LViMDSkbim
— Mark Zuckerberg (@finkd) September 1, 2026
Dynamische Latenz senkt Fehlerquote
Muse Voice Transcribe verarbeitet Audiosignale in Blöcken von 80 Millisekunden. Das Modell entscheidet dabei für jeden Block, ob es sofort ein Wort als Text ausgibt oder auf weitere gesprochene Informationen wartet. Meta nennt diese Funktion »Adaptive Delay«.
Quelle: Meta
Bei einfachen Wörtern liefert Muse Voice Transcribe den Text sofort. Bei schwer verständlichen Passagen wartet es länger ab. Dieser Ansatz senkt die Fehlerquote, nimmt dafür aber bei schwierigen Wörtern eine höhere Latenz in Kauf. Meta nutzt Reinforcement Learning, um dem Modell diese Balance zwischen Geschwindigkeit und Worterkennungsrate (WER) anzutrainieren.
Anzeige
Erkennung von 20 Sprechern
Neben der reinen Texterkennung unterscheidet das Modell automatisch zwischen verschiedenen Sprechern und erkennt, wann eine Aussage endet.
Muse Voice Transcribe verarbeitet Audiospuren, die länger als eine Stunde dauern und über 20 verschiedene Sprecher beinhalten. Eine nachträgliche Bearbeitung oder Trennung der Dateien ist dafür nicht notwendig. Das Modell ordnet jedem Sprecher ein eigenes Token zu und protokolliert den genauen Start- und Endpunkt einer Äußerung im laufenden Betrieb.
Quelle: Meta
Sprachwechsel im laufenden Satz
Meta hat Muse Voice Transcribe mit über 70 Sprachen trainiert. Zum Start sind 25 davon validiert. Das Modell kann innerhalb eines gesprochenen Satzes zwischen verschiedenen Sprachen wechseln. Zweisprachige Personen müssen sich beim Sprechen daher nicht auf eine Sprache festlegen.
Entwickler können die Erkennung durch die Vorgabe von Schlüsselwörtern lenken, um Eigennamen oder spezifische Fachbegriffe zu priorisieren.
Muse Voice Transcribe steht über die Meta Model API zur Verfügung, inklusive einer Nutzungsstufe ohne Datenspeicherung. Für Endnutzer läuft das Modell bereits in der Diktierfunktion der Mac-App von Meta AI sowie in der Entwicklungsumgebung Muse Code.


