Qwen3.8-Omni-Flash verarbeitet Ton und Video gemeinsam und erstellt daraus Skills

Alibaba erweitert seine Qwen3.8-Reihe um Omni-Flash. Das Modell verarbeitet Text, Bilder, Ton und Video gemeinsam und erledigt mit Agenten auch mehrstufige Aufgaben. Eine Erweiterung erstellt aus einer gefilmten Arbeitsanleitung einen wiederverwendbaren Agent Skill. Zur Modellfamilie gehört außerdem eine Realtime-Variante für Gespräche mit laufendem Ton- und Videostream.
Was Omni vom normalen Qwen3.8-Flash unterscheidet
Das reguläre Qwen3.8-Flash versteht bereits Bilder und Videos. Wer etwa eine Bildschirmaufnahme zusammenfassen lässt, bekommt also auch dort eine Antwort. Omni-Flash legt den Schwerpunkt auf die gemeinsame Auswertung von Bild und Ton. Bei einem Meeting kann es Sprecher anhand beider Spuren zuordnen, Aussagen transkribieren und daraus Aufgaben ableiten. Für solche Schritte kann es weitere Programme aufrufen. Ein Kontextfenster von einer Million Token bieten beide Versionen.
Bei langen Videos sucht z.B. ein Agent gezielt nach den Stellen, die für eine Frage relevant sind. Im OmniVideoBench stieg die Trefferquote mit diesem Vorgehen von 63,4 auf 67,8 Punkte. Zugleich sank der Tokenverbrauch pro Frage von 145.736 auf 79.117. Verglichen werden hier zwei Arbeitsweisen desselben Modells.
Quelle: Alibaba
Aus einer Bildschirmaufnahme wird ein Agent Skill
Der »Omni Skill Creator« gehört zu den separat verfügbaren Qwen-MM-Plugins. Er wertet eine Videoanleitung oder Bildschirmaufnahme aus und hält die gezeigten Schritte in einer Skill.md-Datei fest. Aus der Aufnahme eines wöchentlichen Berichts entsteht so ein Ablauf für spätere Berichte. Die Erweiterung erfasst dabei auch den Einsatz von Programmen und Entscheidungskriterien aus der Vorführung. Der fertige Skill lässt sich anschließend mit Agenten wie Codex, Claude Code oder Qwen Code wiederverwenden.
Die Realtime-Version verarbeitet Kamera- und Mikrofondaten fortlaufend, während das reguläre Omni-Modell fertige Aufnahmen analysiert. Sie verbindet Geräusche mit dem sichtbaren Geschehen, kann Schallquellen im Raum verorten und während eines Gesprächs weitere Programme aufrufen. Damit reagiert ein Agent auf das, was gerade um ihn herum passiert.
Anzeige
Textleistung bleibt nahe an Flash
Die von Qwen veröffentlichten Benchmarkwerte zeigen, dass die Textleistung bei beiden Flash-Versionen ähnlich ist. Beim Wissenstest HLE erreicht Omni-Flash 36,5 Punkte gegenüber 35,9 für Flash. In Qwens CoWorkBench für längere Büroaufgaben stehen 75,3 gegen 73,9 Punkte. Bei DeepSWE 1.1 für längerfristige Programmieraufgaben liegt Omni mit 57,8 knapp hinter Flash mit 58,7.
Deutlicher ist der Abstand zum älteren Qwen3.5-Omni-Plus beim multimodalen Werkzeugeinsatz: 71,0 statt 34,5 Punkte in WildClawBench-MM.
Omni-Flash ist über Alibaba Model Studio per API in mehreren Regionen verfügbar, darunter Frankfurt. Das reguläre Modell gibt Text aus. Für gesprochene Antworten und laufende Gespräche ist die gesonderte Realtime-Version vorgesehen. Modellgewichte für Omni-Flash nennt die Ankündigung nicht. Offen verfügbar sind die zugehörigen Plugins und der Qwen-Live Harness.
