- Blog
- MiniMax H3 ComfyUI : Guide complet de configuration pour les flux de travail T2V, I2V et R2V
MiniMax H3 ComfyUI : Guide complet de configuration pour les flux de travail T2V, I2V et R2V

Aperçu de l’IA
Peut-on exécuter MiniMax H3 localement dans ComfyUI ?
Oui. MiniMax H3 dispose de poids ouverts (open weights) et est pris en charge nativement dans ComfyUI 0.30.0 ou version ultérieure. Chargez un modèle préconfiguré (template) H3, téléchargez le modèle de diffusion requis, l’encodeur textuel et les deux VAE, puis exécutez-le sur votre propre matériel.
Quels flux de travail MiniMax H3 prend-il en charge dans ComfyUI ?
ComfyUI fournit des modèles préconfigurés (templates) H3 pour la génération texte-vidéo (T2V), image-vidéo (I2V) avec images initiale/final optionnelles, et référence-vidéo (R2V). Les trois peuvent générer nativement une piste audio stéréo contenant dialogue, effets sonores et musique synchronisés avec la vidéo.
De combien de VRAM avez-vous besoin pour exécuter MiniMax H3 dans ComfyUI ?
Il n’existe pas de seuil minimal absolu unique. Une carte graphique de 24 Go constitue une cible pratique pour le flux de travail élagué (pruned) en int8 ; des tests communautaires réduits à 480p ont toutefois réussi sur 12 Go de VRAM, accompagnés de 32 Go de RAM système, d’un déchargement (offloading) actif et d’un stockage rapide.
Prêt à essayer par vous-même ?
Crédits offerts à l'inscription. Forfaits à partir de $20/mois.
Existe-t-il une alternative plus simple à l’exécution locale de MiniMax H3 dans ComfyUI ?
Oui. Seedance propose une génération audio-vidéo directement dans le navigateur, sans téléchargement local de modèles, sans configuration manuelle de nœuds ni planification de la mémoire GPU — ce qui simplifie grandement la production lorsque l’objectif est d’obtenir un clip finalisé plutôt qu’un graphe personnalisé local.
Qu’est-ce que MiniMax H3 et pourquoi l’exécuter dans ComfyUI ?
MiniMax H3 est un modèle génératif à poids ouverts et multimodal capable de traiter conjointement texte, images, vidéo et audio dans un même contexte. Il peut produire des vidéos allant jusqu’à une résolution 2K, à 24 images par seconde et d’une durée d’environ 15 secondes, avec voix, effets sonores et musique générés simultanément sous forme d’audio stéréo natif.
ComfyUI transforme ces capacités en un graphe de nœuds visuel. Vous pouvez choisir la précision du modèle, la graine (seed), la résolution, la durée, le planificateur (scheduler), les références, l’image initiale ou finale, ainsi que le chemin de sortie — puis enregistrer le graphe comme un flux de travail reproductible. Des modèles préconfigurés natifs couvrent les cas T2V, I2V et R2V, tandis que les nœuds H3 fondamentaux peuvent être recombinés pour créer des graphes plus spécialisés.
Exécutez H3 localement lorsque le contrôle fin des paramètres, la réutilisabilité des nœuds, la confidentialité des entrées ou l’automatisation par lots revêtent plus d’importance que le temps de configuration. Ce choix convient aux créateurs déjà familiers avec ComfyUI, ainsi qu’aux équipes souhaitant éviter les quotas API par appel. L’inconvénient réside dans l’espace disque important requis, la planification minutieuse de la mémoire GPU, les longs téléchargements et une résolution de problèmes plus complexe qu’avec un flux de travail basé sur le navigateur.
Configuration système requise et téléchargements des modèles
Mettez à jour ComfyUI vers la version 0.30.0 ou ultérieure, puis ouvrez Workflow → Browse Workflow Templates → Video et sélectionnez un modèle préconfiguré (template) MiniMax H3. ComfyUI peut vous inviter à télécharger les fichiers manquants, mais leur placement manuel facilite le diagnostic des problèmes.
| Fichier requis | Emplacement | Finalité |
|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors |
ComfyUI/models/diffusion_models/ |
Génération T2V, I2V, et images initiale/final |
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors |
ComfyUI/models/text_encoders/ |
Compréhension multimodale des invites (prompts) et références |
minimax_h3_video_vae_fp16.safetensors |
ComfyUI/models/vae/ |
Encodage et décodage des latents vidéo |
minimax_h3_audio_vae_fp32.safetensors |
ComfyUI/models/vae/ |
Encodage et décodage natif de l’audio |
Pour R2V, utilisez minimax_h3_ref2va_pruned_int8_convrot.safetensors dans diffusion_models/, au lieu du fichier de diffusion FL2VA. Conservez les noms de fichiers complets ; après les avoir ajoutés, actualisez la liste des modèles ou redémarrez ComfyUI.
Considérez 24 Go de VRAM comme une cible confortable pour le chemin élagué (pruned) en int8, non comme un minimum officiellement publié. Les cartes graphiques à moindre mémoire nécessitent des cadres plus petits, des clips plus courts, un déchargement (offloading) agressif, ainsi qu’une quantité suffisante de RAM système et d’espace NVMe pour les échanges de modèles. Si le graphe ne parvient pas à charger ou passe la majeure partie de son temps en échange (swapping), réduisez d’abord la résolution ou déplacez le flux de travail vers un environnement cloud.
Configuration du flux de travail MiniMax H3 Texte-vidéo (T2V)
- Ouvrez la bibliothèque de modèles préconfigurés (Template Library) et chargez MiniMax H3 T2V.
- Vérifiez que le modèle de diffusion, l’encodeur textuel Qwen3-VL, le VAE vidéo et le VAE audio sont bien sélectionnés.
- Dans Resolution Selector, choisissez le format d’image (aspect ratio) et le nombre de mégapixels ; conservez
multipleà32. - Saisissez une invite structurée, définissez la durée et la graine (seed), puis mettez le graphe en file d’attente (queue).
- Examinez l’image, le dialogue, les effets, la musique et la dernière image avant d’augmenter la résolution.
La zone de travail native d’H3 utilise un côté court de 768 px et limite un côté à environ 1344 px. Environ 1,0 mégapixel au format 16:9 correspond à une résolution d’environ 1344×768. Commencez avec une résolution inférieure pour tester les invites, puis n’augmentez que la configuration approuvée. La durée s’aligne automatiquement sur la grille de blocs d’images d’H3 à 24 ips, donc ComfyUI peut ajuster légèrement la valeur demandée.
Rédigez d’abord la scène, puis les actions chronométrées, les mouvements de caméra et l’audio dans le même bloc d’invite. Une description claire et concise pour T2V est plus fiable qu’une liste d’adjectifs cinématographiques non liés. Pour un point de départ hébergé plus rapide, le flux de travail Seedance Texte-vidéo supprime les étapes de configuration locale du graphe et de téléchargement.
Sortie officielle du modèle préconfiguré ComfyUI pour MiniMax H3 T2V. Il s’agit d’un exemple réel de flux de travail, réhébergé sur Seedance R2 pour une lecture fiable.
Configuration du flux de travail MiniMax H3 Image-vidéo (I2V)
Le modèle préconfiguré (template) I2V utilise MiniMaxH3ImageToVideo. Connectez une image à first_frame, connectez éventuellement une autre image à last_frame, puis décrivez le mouvement entre elles. Ces deux entrées sont facultatives au niveau du nœud, ce qui signifie que les mêmes poids FL2VA peuvent prendre en charge des flux de travail guidés par texte, par image initiale, par image finale, ou par les deux images combinées.
I2V fonctionne particulièrement bien pour les présentations de produits, la continuité des personnages, les transitions contrôlées et l’animation guidée par le style. Ajustez la sortie à la zone de travail native d’H3 (côté court de 768 px), veillez à ce que les dimensions soient divisibles par 32, et évitez de fournir une source trop petite ou fortement compressée. Décrivez d’abord ce qui doit rester inchangé, puis décrivez le mouvement de caméra.

L’image d’entrée réelle fournie avec le modèle MiniMax H3 I2V pour ComfyUI.
Résultat officiel I2V obtenu à partir de cette image source. Comparez la forme du produit, les matériaux, le positionnement de la molette, la trajectoire de la caméra et le son — pas seulement l’impact de la première image.
Si vous souhaitez appliquer la même idée « entrée → mouvement » sans gérer localement les poids, essayez Seedance Image to Video.
Configuration du flux de travail MiniMax H3 Reference-to-Video (R2V)
Le R2V utilise MiniMaxH3ReferenceToVideo ainsi que les poids de diffusion séparés ref2va. Il accepte des entrées mixtes (images, vidéos et sons), ce qui permet à une séquence cible d’emprunter l’identité du personnage, le style visuel, le mouvement du sujet, le déplacement de la caméra ou la voix à partir de sources différentes.
Connectez les références dans un ordre intentionnel et nommez-les exactement dans l’invite : <Picture 1>, <Video 1> et <Audio 1>. Attribuez une tâche précise à chaque référence. Par exemple : préserver le personnage issu de <Picture 1>, utiliser le mouvement de travelling de <Video 1> et reproduire la voix de <Audio 1>. Le flux de travail actuel de ComfyUI prend en charge jusqu’à neuf images, trois vidéos et trois fichiers audio autonomes.
Utilisez ref_image_size=match pour des tests plus rapides, ou max afin de conserver l’arête la plus courte d’une référence jusqu’à 2048 px lorsque l’identité prime sur la vitesse. Trop de références superposées peuvent affaiblir le respect des instructions ; validez donc d’abord un graphe à deux références avant d’en ajouter davantage.
Sortie officielle du modèle R2V utilisant les références de personnage et de style fournies.
Pour un flux de travail R2V hébergé, ouvrez Seedance Reference to Video. Le guide vidéo de référence MiniMax H3 propose un tutoriel approfondi sur la rédaction des invites et l’attribution des références.
Conseils pour rédiger des invites efficaces avec MiniMax H3
Utilisez trois champs explicites dans les invites destinées à H3 : integrated_multimodal_description, overall_soundscape et non_diegetic_music. Dans la description de la scène, indiquez les plans chronométrés, les actions visibles, les consignes de caméra et le dialogue exact. Attribuez aux intervenants récurrents des identifiants stables tels que (S1) et placez uniquement les mots parlés à l’intérieur de <d>[English] ...</d>.
T2VA — faible : Une scène urbaine cinématographique avec un son cool.
T2VA — meilleur : 0–3 s : plan large d’un passage piéton sous la pluie, travelling lent vers l’avant ; 3–7 s : un coursier se tourne vers la caméra. Bruits de pas et circulation en stéréo ; percussions basses débutant à 4 s.
I2VA/FL2VA — faible : Animer cette image de façon spectaculaire.
I2VA/FL2VA — meilleur : Préserver la géométrie du produit, la molette, les boutons, le boîtier transparent et l’éclairage bleu-orange. Une orbite lente de 30 degrés ; aucun texte ni élément nouveau. Fin alignée sur la dernière image fournie.
R2V — faible : Utiliser toutes les références pour produire une vidéo dynamique.
R2V — meilleur : Conserver l’identité et la tenue de <Picture 1> ; copier uniquement le mouvement de caméra de <Video 1> ; reproduire le timbre vocal de <Audio 1>. Ne pas transférer le sujet ou l’arrière-plan de la vidéo.
Le T2VA exige une description complète du monde. L’I2VA doit protéger la source avant d’y ajouter du mouvement. Le FL2VA et le L2VA doivent décrire la transition vers l’image limite fournie. Le R2V doit expliciter la relation entre chaque référence et la cible. Le guide d’écriture des invites MiniMax H3 développe ces modèles spécifiques à chaque mode.
MiniMax H3 dans ComfyUI local vs. outils vidéo IA basés navigateur
| Critère | H3 local dans ComfyUI | Seedance | Comfy Cloud |
|---|---|---|---|
| Installation | Installer/mettre à jour ComfyUI et placer les poids volumineux | Ouvrir dans un navigateur | Charger un modèle ComfyUI hébergé |
| VRAM locale | Nécessaire ; les paramètres dépendent de la précision et de la sortie | Non nécessaire | Non nécessaire localement |
| Contrôle du flux de travail | Contrôle complet au niveau des nœuds et automatisation | Interface simplifiée de génération | Graphe ComfyUI sans matériel local |
| Audio natif | Audio stéréo H3 généré simultanément avec la vidéo | Flux de travail conjoint audio/vidéo | Même flux de travail H3 sur calcul cloud |
| Idéal pour | Personnalisation poussée, entrées locales, graphes réutilisables | Idéation et production rapides sans installation | Utilisateurs ComfyUI dépourvus de GPU local |
Choisissez ComfyUI local lorsque le graphe lui-même fait partie intégrante de votre système de production. Optez pour ComfyUI hébergé dans le cloud si vous souhaitez bénéficier de ses nœuds sans supporter la charge matérielle. Préférez Seedance si vous voulez passer rapidement de l’invite ou de la référence à un extrait utilisable, avec un minimum de décisions infrastructurelles. Essayez Seedance directement dans votre navigateur →
Conclusion
MiniMax H3 constitue l’une des options open-weights les plus performantes disponibles dans ComfyUI pour générer conjointement vidéo et audio natif. Procédez en trois étapes : mettez à jour ComfyUI vers la version 0.30.0 ou ultérieure, placez le modèle de diffusion, l’encodeur textuel et les deux VAE dans leurs dossiers respectifs, puis chargez le modèle T2V, I2V ou R2V correspondant. Limitez vos premiers essais à des configurations simples, attribuez une tâche précise à chaque référence, et n’augmentez la résolution qu’après validation fonctionnelle de l’invite ; si les téléchargements locaux, la gestion de la VRAM et l’entretien des nœuds pèsent plus lourd que l’avantage d’un contrôle approfondi, un flux de travail Seedance basé navigateur constitue la voie la plus rapide vers la production.
Prêt à essayer par vous-même ?
Mettez en pratique les étapes de ce guide dans Seedance et transformez vos prompts ou images en vidéos abouties en quelques minutes.
Crédits offerts à l'inscription. Forfaits à partir de $20/mois.
Articles associés
D'autres articles dans la même langue à lire ensuite.

MiniMax H3 Turbo LoRA : Guide de configuration pour une génération vidéo 5× plus rapide
Installez le LoRA MiniMax H3 Turbo dans ComfyUI, choisissez la version v4 ou v1, connectez le sampler, puis ajustez la génération sur 4 à 8 étapes pour obtenir des vidéos plus rapides avec un son stéréo.
Lire l'article
Correction des sons incohérents avec MiniMax H3 : causes et solutions
Corrigez les sons incohérents générés par MiniMax H3 grâce à des balises de dialogue plus propres, des invites raccourcies, des identifiants d’orateur stables, des scénarios monolingues et des flux de travail de secours pratiques.
Lire l'article
Seedance 2.5 Illimité : Forfaits, crédits et comment générer davantage de vidéos
Découvrez ce que signifie réellement « Seedance 2.5 illimité », comparez les forfaits et les crédits, estimez la production mensuelle de vidéos et améliorez vos invites pour une production à haut volume.
Lire l'article