ComfyUI integriert MiniMax H3 für 2K-Video und Audio
MiniMax hat heute die dritte Generation seines KI-Videomodells H3 veröffentlicht und damit einen wichtigen Schritt für Open-Weights-KI-Videoerstellung markiert. Im Gegensatz zu den Vorgängern Hailuo 01 und 02 liefert das Unternehmen H3 erstmals mit frei verfügbaren Gewichten aus, was eine dezentrale Nutzung und direkte Integration in lokale Produktionsumgebungen ermöglicht. Das Modell verarbeitet Text, Bilder, Videoclips und Audio parallel und generiert daraus in einem einzigen Inferenzdurchlauf Videos in 2K-Auflösung mit einer maximalen Dauer von 15 Sekunden. Ein zentrales Alleinstellungsmerkmal ist die native Stereo-Tonausgabe, die nicht als nachgelagerter Prozess, sondern integriert in die Generierung erstellt wird. Diese Architektur vereint bisher fünf getrennte KI-Aufgaben in einem einzigen System und verarbeitet multimodale Inputs kohärent anhand eines kombinierten Prompts. Die technische Umsetzung von H3 zielt stark auf produktionsnahe Arbeitsabläufe ab. Mit der Motion-Transfer-Funktion können Referenzvideos zur Steuerung von Kamerabewegungen, Darstellungen oder Schnittfrequenzen dienen, während Sujet und visueller Stil unabhängig definiert werden. In Kombination mit In-Place-Editing ermöglicht dies ein effizientes, iteratives Verfeinern einzelner Shots. Für die lokale Ausführung auf Consumer-Hardware haben die Entwickler das Modell durch massives Engineering optimiert. Durch das Ersetzen von rund vierzig Prozent der Modulationsgewichte durch äquivalente Lookup-Tabellen sowie den Einsatz einer präzisen int8-Quantisierung und benutzerdefinierter Rechenschnittstellen konnte der VRAM-Verbrauch um sechzigsechs Prozent reduziert werden. Der Speicherbedarf sank von 123,6 auf 42,5 Gigabyte, sodass die Ausführung nun auch auf Grafikkarten wie der RTX 3060 möglich ist. Die native Unterstützung in ComfyUI ist ab sofort verfügbar. Nutzer benötigen die Version 0.30.0 oder greifen auf Comfy Cloud zurück. Über das offizielle Comfy-Org-Repository stehen die Gewichte sowie vordefinierte Workflows für Bild-zu-Video, Referenz-Video-zu-Video und Text-zu-Video bereit. Nach dem Download und der Ablage im korrekten Modellverzeichnis genügt das Verknüpfen der Inputs und das Ausführen des Graphen zur Generierung. Mit H3 etabliert MiniMax einen neuen Standard für hochauflösende, audiounterstützte Videoerstellung. Die offene Architektur und die drastische Hardware-Optimierung demokatisieren professionelle KI-Videopipelines und reduzieren die Abhängigkeit von teuren Cloud-Infrastrukturen deutlich.
