Menschen reden durcheinander

Metas neue KI hört Gesprächen in Echtzeit zu

Andreas Becker GPT-Images-2.0
Menschen reden durcheinander

Meta hat mit Muse Voice Transcribe ein neues Audio-Modell für Echtzeit-Transkriptionen veröffentlicht. Laut CEO Mark Zuckerberg belegt es derzeit den ersten Platz in unabhängigen Benchmarks und ist bereits in ersten Anwendungen verfügbar.

Twitter Beitrag - Cookies links unten aktivieren.

Dynamische Latenz senkt Fehlerquote

Muse Voice Transcribe verarbeitet Audiosignale in Blöcken von 80 Millisekunden. Das Modell entscheidet dabei für jeden Block, ob es sofort ein Wort als Text ausgibt oder auf weitere gesprochene Informationen wartet. Meta nennt diese Funktion »Adaptive Delay«.

Quelle: Meta

Bei einfachen Wörtern liefert Muse Voice Transcribe den Text sofort. Bei schwer verständlichen Passagen wartet es länger ab. Dieser Ansatz senkt die Fehlerquote, nimmt dafür aber bei schwierigen Wörtern eine höhere Latenz in Kauf. Meta nutzt Reinforcement Learning, um dem Modell diese Balance zwischen Geschwindigkeit und Worterkennungsrate (WER) anzutrainieren.

Anzeige

Erkennung von 20 Sprechern

Neben der reinen Texterkennung unterscheidet das Modell automatisch zwischen verschiedenen Sprechern und erkennt, wann eine Aussage endet.

Muse Voice Transcribe verarbeitet Audiospuren, die länger als eine Stunde dauern und über 20 verschiedene Sprecher beinhalten. Eine nachträgliche Bearbeitung oder Trennung der Dateien ist dafür nicht notwendig. Das Modell ordnet jedem Sprecher ein eigenes Token zu und protokolliert den genauen Start- und Endpunkt einer Äußerung im laufenden Betrieb.

Quelle: Meta

Sprachwechsel im laufenden Satz

Meta hat Muse Voice Transcribe mit über 70 Sprachen trainiert. Zum Start sind 25 davon validiert. Das Modell kann innerhalb eines gesprochenen Satzes zwischen verschiedenen Sprachen wechseln. Zweisprachige Personen müssen sich beim Sprechen daher nicht auf eine Sprache festlegen.

Entwickler können die Erkennung durch die Vorgabe von Schlüsselwörtern lenken, um Eigennamen oder spezifische Fachbegriffe zu priorisieren.

Muse Voice Transcribe steht über die Meta Model API zur Verfügung, inklusive einer Nutzungsstufe ohne Datenspeicherung. Für Endnutzer läuft das Modell bereits in der Diktierfunktion der Mac-App von Meta AI sowie in der Entwicklungsumgebung Muse Code.

Von Menschen für Menschen

Jeder Artikel entsteht durch menschliche Ideen und sorgfältige Prüfung. KI unterstützt uns vor allem bei Recherche und Feinschliff. Wir freuen uns über jede Unterstützung.

Jeder Beitrag zählt – auch das Teilen.