- Blog
- MiniMax H3 : Workflow à deux étapes — Guide haute résolution pour ComfyUI
MiniMax H3 : Workflow à deux étapes — Guide haute résolution pour ComfyUI

Aperçu de l’IA
Qu’est-ce que le flux de travail en deux étapes MiniMax H3 ?
Il construit le mouvement, la composition et le son sur une toile initiale plus petite, puis agrandit le latent H3 et exécute une seconde passe à faible bruit afin de reconstruire les détails haute résolution.
Est-il plus rapide que la génération directe en haute résolution ?
Généralement, oui, pour les itérations, car la première passe est moins coûteuse. La passe de raffinement s’approche toutefois toujours de la résolution cible, donc la mémoire vidéo maximale (VRAM) et le temps total dépendent de l’échelle, de la durée et du déchargement (offloading).
La deuxième étape préserve-t-elle l’audio natif MiniMax H3 ?
Oui, cela est possible. Un rééchantillonneur (upscaler) latent H3 compatible transporte le latent audio vers l’avant et vous permet de le verrouiller ou de l’ajuster légèrement ; un débruitage audio excessif peut toutefois remplacer ou brouiller la bande-son.
Qui devrait utiliser ce flux de travail ?
Il convient aux utilisateurs de ComfyUI qui ont besoin d’une sortie H3 plus nette, de brouillons plus rapides ou d’une solution à faible consommation de VRAM, et qui peuvent vérifier l’identité, le mouvement et l’audio entre les deux passes.
Ce que fait réellement le flux de travail en deux étapes MiniMax H3
Un flux de travail MiniMax H3 en deux étapes sépare les décisions créatives de la reconstruction des détails. La première étape résout le mouvement, le déplacement de la caméra, le rythme et l’audio natif sur une toile modeste. La deuxième étape agrandit ce latent approuvé et échantillonne la trajectoire à moindre bruit, reconstruisant la texture sans inventer une nouvelle interprétation.
Étape 1 : verrouiller le mouvement, la composition et l’audio
Commencez par une prise courte et mesurable, et fixez l’invite (prompt), la graine (seed), la durée, la fréquence d’images (frame rate) et les références. Une toile plus petite rend moins coûteuse la détection d’un déplacement de caméra ou d’un geste de la main erroné. Examinez l’intégralité de la séquence vidéo et rejetez les mouvements défectueux avant le raffinement.

Une première passe utile conserve la même personne, la même blouse, le même atelier, le même outil et la même forme du verre, tous restant reconnaissables alors que la prise évolue d’un plan large d’action à un gros plan détaillé.
Étape 2 : augmenter la résolution et reconstruire les détails
Alimentez la sortie débruitée du premier échantillonneur (sampler) dans un rééchantillonneur latent compatible H3. Mettez à jour les conditions (conditioning) pour les nouvelles dimensions, ajoutez uniquement suffisamment de bruit pour générer des détails, puis exécutez le deuxième échantillonneur sur une plage de sigmas plus faible. Décodez après raffinement afin de préserver la structure tout en résolvant les microtextures.
Échantillonnage en deux étapes vs rendu direct vs rééchantillonnage pixelisé post-décode
| Méthode | Usage optimal | Avantage principal | Risque principal |
|---|---|---|---|
| Rendu direct à la résolution cible | Plans finals sur matériel performant | Chemin d’échantillonnage unique | Tentatives infructueuses coûteuses |
| Flux de travail latent H3 en deux étapes | Mouvement approuvé nécessitant davantage de détails | Reconstruction des détails avant décodage | Trop de réintroduction de bruit peut modifier l’identité ou l’audio |
| Rééchantillonnage pixelisé post-décode | Prise stable ne nécessitant qu’un fichier de livraison plus grand | Préservation fiable du mouvement | Incapacité à récupérer chaque détail sémantique manquant |
Pour des expériences visuelles rapides sans graphe local, testez la même structure de prise dans le flux de travail image-vers-vidéo de Seedance, puis comparez plutôt le mouvement et les détails exploitables que les simples étiquettes de résolution.
Ce dont vous avez besoin avant d’importer le flux de travail
Modèles, encodeurs et fichiers VAE
Commencez avec un flux de travail MiniMax H3 qui fonctionne déjà correctement. Vérifiez le point de contrôle (checkpoint) ou le modèle quantifié, l’encodeur de texte, le VAE et les chemins vers les modèles. Enregistrez ce graphe séparément comme chemin de retour (rollback path).
Nœuds personnalisés requis
Utilisez un rééchantillonneur conçu spécifiquement pour le latent vidéo-et-audio compact de H3, et non un nœud générique d’image. Le premier échantillonneur doit exposer sa sortie débruitée, le rééchantillonneur doit transporter l’audio, et la deuxième étape doit accepter les conditions reconstruites. Résolvez tous les nœuds manquants avant tout test.
Planification matérielle
Deux étapes réduisent le coût des brouillons défectueux, mais ne garantissent pas une mémoire maximale inférieure. La passe de raffinement traite encore le latent agrandi. La VRAM, la mémoire système, la précision, le déchargement (offloading), la durée et la toile cible sont tous des facteurs déterminants. Effectuez votre premier test brièvement et laissez suffisamment d’espace disque pour les modèles, les latents et les images décodées.
Si un projet mélange génération hébergée et locale, le flux de travail vidéo IA multi-modèle montre comment acheminer les prises selon leur coût, leur niveau de contrôle et leur risque de production.
Comment construire le graphe ComfyUI en deux étapes
Commencez avec une base H3 éprouvée
Exécutez d’abord le graphe texte-vers-vidéo, image-vers-vidéo ou référence-vers-vidéo inchangé. Utilisez un seul sujet, une seule action, une seule instruction caméra et une seule condition sonore. Enregistrez la graine (seed), les dimensions, le nombre d’images, l’échantillonneur, la précision et le temps de rendu. Si cette base échoue, un affinateur (refiner) ne fera que masquer la cause sous-jacente.
Connectez la première étape au rééchantillonneur latent
Acheminez la sortie débruitée du premier échantillonneur — et non une image décodée — vers le rééchantillonneur latent H3. Utilisez des dimensions prises en charge par le graphe et commencez par une augmentation modérée de l’échelle afin que la préservation du mouvement soit facile à évaluer.

Le côté droit doit ajouter des poils individuels, une structure plus définie des gouttes d’eau et une texture de surface plus fine, sans modifier la posture, la silhouette, l’expression du chien ni l’éclairage du lever de soleil.
Reconstruisez les conditions pour la nouvelle toile
Mettez à l’échelle les conditions d’image ou de référence aux dimensions de la deuxième étape. Une inadéquation de taille peut déformer les visages, décaler le cadrage ou réinterpréter le sujet. Conservez une force de référence modérée, et n’augmentez-la que si l’identité continue de dériver.
Exécutez la passe de raffinement à faible sigma
Connectez le latent agrandi à un deuxième échantillonneur avec le bruit externe désactivé et une plage de sigmas plus faible. Testez la répartition (split) plutôt que de copier une valeur universelle. Décodez à l’aide du VAE compatible et enregistrez la vidéo ainsi que l’audio ensemble. Le guide des compétences de l’agent IA MiniMax H3 présente une autre méthode pour organiser les références et la synchronisation.
Meilleurs paramètres pour haute résolution, rapidité et audio natif
Choisissez la toile de base et le facteur d’échelle
La toile de base doit définir les visages, les mains et les petits objets, tout en maintenant un coût faible pour les versions rejetées. Commencez près d’une résolution H3 éprouvée, puis testez un seul pas d’échelle modéré. Les visages éloignés peuvent nécessiter une toile de base plus grande ; ne jugez donc pas ce paramètre à partir d’un seul plan facile.
Divisez délibérément les étapes et les valeurs sigma
L’échantillonnage à plus fort bruit détermine la composition et le mouvement ; l’échantillonnage à moindre bruit résout la texture. Si la deuxième étape modifie les membres ou la direction de la caméra, commencez le raffinement plus tard ou réduisez le débruitage. Si elle n’ajoute presque rien, exposez légèrement davantage la trajectoire à moindre bruit. Modifiez un seul paramètre par test.
Verrouillez, polissez ou remixez l’audio
Traitez l’audio comme une branche délibérée. Utilisez audio_denoise à zéro lorsque la première étape produit déjà un dialogue, une ambiance ou une musique utilisables. Une faible valeur peut polir la texture ; une valeur forte risque de générer des sons incohérents, des décalages temporels ou un ton ambiant différent.

Un gros plan musical constitue un test exigeant : la trame raffinée doit maintenir l’archet sur les cordes, les doigts sur la touche, l’identité faciale stable, et la note audible parfaitement alignée avec le mouvement.
Lancez l’échantillon complet et observez les impacts des baguettes, les mouvements des cymbales, la continuité des mains, ainsi que la fidélité du son au rythme visible.
Pour les plans où plusieurs références visuelles ou audio doivent remplir des rôles distincts, organisez-les d’abord à l’aide de l’espace de travail référence-vers-vidéo.
Paramètres basse consommation VRAM qui comptent
Utilisez le déchargement de modèle, une attention efficace prise en charge, un nombre conservateur d’images par séquence et un seul lot. Décodez uniquement la version que vous allez inspecter. Si la deuxième étape épuise encore la mémoire, réduisez la taille cible ou la durée avant d’empiler davantage d’optimiseurs.
Comment importer et valider un fichier JSON de flux de travail MiniMax H3
Importer et résoudre les dépendances
Glissez-déposez le fichier JSON du flux de travail dans ComfyUI, lisez la liste des nœuds manquants, puis vérifiez chaque dépôt et chaque chemin vers les modèles. Après le redémarrage, confirmez que les entrées n’ont pas été réinitialisées. Conservez le fichier JSON original et versionnez séparément votre graphe modifié.
Exécuter un test de référence contrôlé
Utilisez un plan de cinq à huit secondes avec une graine fixe. Enregistrez les résultats de la première étape, de la double étape et de la résolution directe sans modifier la demande. Pour une référence propre, le générateur texte-vers-vidéo permet de distinguer les problèmes liés à la demande de ceux liés au graphe.
Comparez ce que les spectateurs peuvent réellement voir et entendre
Enregistrez le temps de rendu, la consommation maximale de VRAM, l’identité, la géométrie, la trajectoire de la caméra, les scintillements, la stabilité de l’arrière-plan, la clarté audio et la synchronisation. Une image fixe peut exagérer la netteté tout en masquant une mauvaise cohérence temporelle ; visionnez donc chaque version à vitesse normale avant d’inspecter les images difficiles.
Conservez la deuxième étape uniquement lorsqu’elle apporte une valeur perceptible. Si elle accentue les détails mais modifie la personne, l’action ou la bande-son, réduisez sa plage de bruit ou utilisez un agrandissement post-décodage.
Résoudre les erreurs OOM, les distorsions audio, les déformations d’identité et le bruit chromatique
La deuxième étape épuise la mémoire
Réduisez d’abord les dimensions cibles, puis raccourcissez la durée ou augmentez le déchargement. Vérifiez que les deux modèles ne résident pas involontairement simultanément sur le GPU ; la deuxième étape peut déterminer la consommation maximale de VRAM.
Les visages ou les personnages changent
Vérifiez les dimensions de conditionnement, la mise à l’échelle des références et le débruitage. Une dérive d’identité signifie généralement que le raffineur dispose d’une trop grande liberté ou qu’il y a un désaccord dans le conditionnement. Testez une toile de base plus proche avant d’ajouter la restauration faciale.
Le dialogue ou l’ambiance devient inaudible
Réglez le débruitage audio à zéro et vérifiez la première étape. Si son audio est instable, accordez-lui davantage de temps dans le planning ou simplifiez la demande. La deuxième étape ne peut pas réparer de façon fiable une performance que la première étape n’a jamais établie.
Les détails semblent surtraités ou du bruit chromatique apparaît
Déplacez le démarrage de la deuxième étape plus tardivement, réduisez son débruitage et vérifiez les versions du VAE et du rééchantillonneur latent. Si le bruit chromatique persiste dans des tests contrôlés, utilisez un rééchantillonnage pixelisé post-décodage plutôt que de forcer le passage par le latent.
Le fichier JSON contient des nœuds manquants ou incompatibles
Faites correspondre les versions des nœuds et testez après chaque modification. Des erreurs latentes imbriquées vidéo-et-audio indiquent souvent qu’un nœud générique a emprunté un chemin spécifique à H3. Revenez à la référence de base et reconnectez une section à la fois.
Conclusion
Utilisez le flux de travail à deux étapes MiniMax H3 comme un pipeline d’approbation : résolvez d’abord le mouvement, la composition et l’audio à moindre coût, puis affinez uniquement les plans dignes d’être conservés. N’acceptez la deuxième étape que lorsqu’elle ajoute des détails sans réécrire la performance. Commencez avec un graphe connu comme fonctionnel, préservez l’audio, comparez un rendu, et modifiez une seule variable à la fois. Pour valider la demande, commencez par le générateur vidéo Seedance AI et transformez la même demande ou la même image en un clip-test.
Prêt à essayer par vous-même ?
Mettez en pratique les étapes de ce guide dans Seedance et transformez vos prompts ou images en vidéos abouties en quelques minutes.
Crédits offerts à l'inscription. Forfaits à partir de $20/mois.
Articles associés
D'autres articles dans la même langue à lire ensuite.

Crédits illimités Higgsfield AI : ce que « illimité » couvre réellement en 2026
Découvrez ce que couvrent réellement les crédits illimités Higgsfield AI, pourquoi des crédits peuvent tout de même être déduits, comment fonctionne le report de crédits, et dans quels cas un flux de travail Seedance direct est plus clair.
Lire l'article
Générateur IA d’images en vidéo avec invite, gratuit en ligne : animez n’importe quelle photo
Transformez n’importe quelle image en vidéo à l’aide d’une invite IA en ligne. Découvrez une formule pratique d’invite, testez la génération gratuite et résolvez les problèmes de mouvement courants.
Lire l'article
Agent vidéo IA Higgsfield MCP : Du paramétrage à la vidéo finale
Découvrez comment fonctionne l’agent vidéo IA Higgsfield MCP, comment l’interconnecter, comment créer un flux de travail vidéo répétable, comment gérer vos crédits, et comparez-le à l’Agent Seedance.
Lire l'article