Ein offenes KI-Videomodell schlägt Omni und Seedance 2
Bisher waren KI-Videos teuer und aufwendig. MiniMax ändert das nun mit einer völlig neuen und offenen Architektur.

Das KI-Unternehmen MiniMax hat mit H3 ein neues Videomodell auf Seedance 2 Niveau vorgestellt. H3 generiert bis zu 15 Sekunden lange Clips in 2K-Auflösung inklusive nativem Stereo-Sound. Der Entwickler will die Modellgewichte in den kommenden Tagen für die Open-Source-Community freigeben.
Multimodalität statt isolierter Aufgaben
H3 verarbeitet Text, Bilder, Video und Audio in einem gemeinsamen Kontext und erzeugt daraus direkt einen fertigen Videoclip mit passendem Ton. Das Modell wertet alle Eingaben gemeinsam aus und benötigt dafür keine separaten Arbeitsschritte für Bild, Bewegung oder Audio.
Technisch nutzt das Modell dafür die sogenannte H3-Contextual Omni Representation. Diese Architektur komprimiert die Eingabedaten von durchschnittlich 100.000 auf etwa 4.000 Token. Die Sprache dient dabei als zentrales Element, um die verschiedenen Formate zu verbinden und für H3 verständlich zu übersetzen.
Videobeispiele zeigt MiniMax auf Twitter:
Twitter Beitrag - Cookies links unten aktivieren.
MiniMax H3: Omni-Reference, Commercial-Grade Generation, Unbeatable Cost Efficiency, Open Weights https://t.co/DLB1xsFfSC
— MiniMax (official) (@MiniMax_AI) July 31, 2026
Native 2K-Auflösung und geringere Kosten
H3 generiert Videos standardmäßig in einer 2K-Auflösung. Das Modell verzichtet dabei auf herkömmliche Upscaling-Module. MiniMax nutzt stattdessen ein Verfahren namens H3-In-context Regeneration.
H3 berechnet seine eigenen, niedrig aufgelösten Ergebnisse direkt im Kontext neu und greift dabei noch einmal auf die ursprünglichen Eingabedaten zurück. Dadurch lassen sich feine Details und kleine Texte präziser wiederherstellen als bei traditionellen Methoden, die fehlende Pixel lediglich erraten.
Ein neuer Tokenizer, der H3-VAE, sorgt für eine hohe Datenkompression, verlängert die effektive Sequenzlänge um das Vierfache und senkt so die Kosten für Training und Ausführung.
Der Preis pro generierter Sekunde liegt bei 2K-Auflösung bei weniger als einem Drittel der Kosten vergleichbarer Konkurrenzmodelle.
In der Bestenliste von Artificial Analysis führt H3 die Kategorie für Videobearbeitung mit Audio an. Bei der Text-zu-Video-Generierung liegt das Modell fast gleichauf mit Googles Gemini Omni Flash auf dem zweiten Platz.
Offene Modellgewichte
Bislang dominieren geschlossene Modelle die Videogenerierung. MiniMax ändert diesen Ansatz und will die Modellgewichte von H3 in den nächsten Tagen veröffentlichen, sofern rechtliche Rahmenbedingungen dies zulassen.
Entwickler können dann eigene angepasste Versionen von H3 erstellen. Die Offenlegung soll auch die Kompatibilität mit verschiedener KI-Hardware beschleunigen.
Für künftige H-Versionen plant MiniMax, die Fähigkeiten der eigenen Textmodelle zu integrieren, um das multimodale Verständnis weiter auszubauen.

