MiniMax H3 sur ComfyUI : vidéo 2K et audio natifs
MiniMax a officiellement dévoilé son modèle de génération vidéo de nouvelle génération, H3, en libérant ses poids ouverts dès aujourd'hui. Soutenu nativement par ComfyUI à partir de la version 0.30.0, ce troisième du nom de l'entreprise se distingue par sa capacité à produire des vidéos en résolution 2K, d'une durée maximale de quinze secondes par extrait, et à intégrer un son stéréo natif généré simultanément à l'image. Plutôt que de traiter chaque format de manière isolée, H3 unifie le traitement multimodal. Il prend en entrée du texte, des images, des vidéos ou de l'audio, et génère une sortie cohérente en reliant ces éléments selon une consigne textuelle. Cette architecture centralise cinq fonctions distinctes, éliminant la nécessité de multiples étapes post-production. Le modèle permet également le transfert de mouvement, où une vidéo de référence fournit la dynamique d'une prise, tandis que le sujet et le style proviennent d'autres sources. Couplé à l'édition intégrée, il facilite l'itération rapide des plans. L'intégration de H3 sur des équipements grand public résulte de travaux d'ingénierie machine learning approfondis. L'équipe de MiniMax a optimisé l'empreinte mémoire du modèle en remplaçant environ quarante pour cent des poids de modulation par des tables de consultation fonctionnellement équivalentes. Cette approche, combinée à une quantisation int8 précise et à des noyaux d'exécution personnalisés, a permis de réduire l'utilisation de la VRAM de soixante-six pour cent, passant de cent vingt-trois gigaoctets à quarante-deux gigaoctets pour les variantes les plus légères. Grâce à cette compression et à un système dynamique de transfert de mémoire, le modèle s'exécute désormais localement sur des cartes graphiques grand public, notamment la NVIDIA RTX 3060. Les utilisateurs peuvent déployer le modèle via la plateforme Comfy Cloud ou en installant la dernière version de ComfyUI. Des workflows prêts à l'emploi sont disponibles pour la génération vidéo à partir d'images, de références ou de texte. Après avoir téléchargé les poids du modèle dans le répertoire dédié et connecté les entrées souhaitées, la génération s'effectue directement dans l'interface. Cette publication marque une étape importante pour l'accessibilité des outils de création vidéo assistée par intelligence artificielle, en offrant des performances professionnelles sur un matériel standard.
