- Blog
- MiniMax H3 Workflow à plusieurs images-clés : maîtrisez le chronométrage, la continuité et les transitions
MiniMax H3 Workflow à plusieurs images-clés : maîtrisez le chronométrage, la continuité et les transitions

Aperçu IA
MiniMax H3 prend-il en charge plusieurs images-clés ?
Oui. En local avec ComfyUI, vous pouvez enchaîner des nœuds MiniMaxH3AddGuide et ancrer des images ou de l’audio à des indices d’images spécifiques. La solution hébergée, plus simple, se concentre sur les images première et dernière, ainsi que sur les références.
Combien d’images-clés un vidéo MiniMax H3 doit-elle comporter ?
Utilisez le nombre minimal d’ancres nécessaire pour définir les états narratifs requis : généralement une ouverture, un ou deux temps de transition et une conclusion. Des images supplémentaires contradictoires peuvent provoquer des morphismes brutaux.
Comment conserver le même personnage entre les images-clés ?
Réutilisez une même référence d’identité, maintenez stables les descriptions de tenue vestimentaire et d’environnement, et assurez la compatibilité de chaque image-clé en termes d’échelle du sujet, d’éclairage, de direction de l’objectif et de position à l’écran.
ComfyUI ou Seedance Agent est-il mieux adapté à ce workflow ?
ComfyUI offre un contrôle précis par indice d’image et par nœud. Seedance Agent constitue la voie la plus simple pour la planification des plans, l’organisation des références, les validations et la réexécution uniquement de la section ayant échoué.
Ce qu’un workflow MiniMax H3 à plusieurs images-clés contrôle réellement
Un workflow MiniMax H3 à plusieurs images-clés indique au modèle quelles états visuels sont essentiels à des moments précis. Une image-clé occupe une position définie sur la ligne temporelle ; une image de référence définit l’identité, le style, le mouvement ou l’environnement, sans nécessairement devenir une image exacte.
Images-clés contre références ordinaires
Utilisez une image-clé lorsque la composition doit être reconnaissable à un instant défini : une boîte fermée au début, un couvercle s’ouvrant à mi-parcours, ou une révélation complète à la fin. Utilisez une référence lorsque le même acteur, produit, pièce, costume ou système chromatique doit demeurer cohérent malgré des compositions changeantes. Le générateur MiniMax H3 prend en charge la création vidéo fortement axée sur les références, tandis qu’un graphe local expose les contrôles temporels de façon plus directe.
Si chaque image devient un point final, H3 peut effectuer des morphismes entre les images plutôt que d’exécuter l’action prévue. Si chaque image ne constitue qu’une référence approximative, la séquence risque de ne jamais atteindre la pose planifiée.
Images première/dernière contre guides intermédiaires
La méthode classique basée sur les images première et dernière définit deux bornes. Le MiniMaxH3AddGuide de ComfyUI permet d’ajouter une image, un court extrait vidéo, un repère audio ou un guide audiovisuel à un frame_idx choisi ; plusieurs nœuds guides peuvent être enchaînés pour créer plusieurs ancres. Cela rend possible un mouvement authentique à trois ou quatre états dans une seule séquence générée.
N’utilisez des guides intermédiaires que pour les temps incontournables. Une main tendue peut ne pas nécessiter sa propre image, mais un produit quittant une position pour arriver intact à une autre en aura probablement besoin.

Un test à quatre ancres doit préserver la géométrie de la bouteille, la teinte du verre, le bouchon, le socle en pierre, le lin et la lumière du jour, tandis que le cadrage progresse vers la révélation finale.
Élaborez un plan d’images-clés avant la génération
Le meilleur résultat commence par une courte ligne temporelle. Décrivez l’action dans l’ordre de lecture et indiquez quels états doivent être exacts ; laissez l’espace entre les ancres libre pour un mouvement naturel.
Transformez une idée en temps narratifs calés
Pour un plan de huit secondes, un plan utile pourrait être : l’image 0 établit le sujet, un guide précoce lance l’action, un guide ultérieur confirme le changement principal, et l’image finale stabilise la scène. À 24 images par seconde, l’image 96 correspond approximativement à quatre secondes, mais calculez toujours par rapport au nombre réel d’images utilisé par le graphe.
| Rôle dans la ligne temporelle | Ce que l’image doit verrouiller | Ce que la description doit préciser |
|---|---|---|
| Ancre initiale | Identité, composition, pose initiale | Mouvement initial et comportement de la caméra |
| Guide intermédiaire | État critique de l’action ou position de l’objet | Comment le sujet atteint cet état et en sort |
| Guide tardif | Résultat, révélation ou relation modifiée | Ralentissement et continuité visuelle |
| Ancre finale | Composition stable finale | Dernier mouvement, son et maintien |
Concevez des images-clés compatibles
Alignez le format d’image, l’échelle du sujet, la hauteur de la caméra, l’objectif, la direction à l’écran et la source lumineuse. Une ouverture large suivie d’un gros plan extrême à mi-parcours pourrait exiger un déplacement de caméra irréaliste. N’introduisez des changements plus importants qu’après validation de l’identité et du déroulé.

Les images-clés réelles, conformes au style de sortie, doivent donner l’impression d’une seule prestation. Ici, l’horloger, son tablier, son établi, ses outils, le matériau laiton et la lumière de la fenêtre restent constants tandis que l’oiseau change d’état.
Attribuez une fonction unique à chaque référence
Nommez chaque ressource selon sa fonction : identité, tenue vestimentaire, environnement, produit, mouvement, image initiale, guide intermédiaire ou image finale. Ne demandez pas à une seule image contradictoire de définir à la fois un acteur différent et le même acteur. Pour une orientation visuelle plus souple, sans positionnement temporel précis, utilisez le workflow référence-vers-vidéo.
Workflow MiniMax H3 à plusieurs images-clés : mode d’emploi étape par étape
1. Créez le latent audiovisuel
Choisissez le format d’affichage, la résolution, la durée et le nombre final d’images avant d’ajouter les guides. Le VAE image doit correspondre au graphe H3, et chaque indice d’image sélectionné doit se situer à l’intérieur de la ligne temporelle du latent. Modifier la durée après avoir placé les guides peut déplacer ou invalider les temps prévus.
2. Ajouter l’ancre initiale
Commencez avec une image nette qui met clairement en évidence le sujet et son environnement. Évitez le flou de bougé, les mains cachées, les produits rognés, les silhouettes illisibles ou une posture déjà instable. L’image initiale établit la géométrie que les repères ultérieurs doivent respecter.
3. Enchaîner les nœuds intermédiaires de guidage
Transmettez la condition positive d’un nœud MiniMaxH3AddGuide à l’autre. Attachez une image approuvée et définissez sa valeur frame_idx. Conservez un ordre chronologique dans le graphe afin que le diagnostic ultérieur reste lisible.
4. Ajouter l’état final
Utilisez l’entrée native pour la dernière image lorsque la composition finale doit être exacte. Assurez-vous qu’elle constitue une destination crédible, et laissez un temps de stabilisation pour l’image produit, le geste achevé ou le raccord net.
5. Rédigez le pont, pas quatre invites séparées
Les images décrivent déjà l’apparence. L’invite doit décrire le mouvement entre elles :
Commencez à partir de la première image approuvée. L’artisan soulève le même vase cobalt à deux mains, marche régulièrement de gauche à droite, puis le pose sur l’étagère en bois préalablement établie. Conservez le même visage, la même chemise olive, le même tablier taché d’argile, les mêmes proportions du vase, la même disposition de l’atelier et la même lumière naturelle. Utilisez un seul mouvement latéral continu de caméra, accompagné de pas naturels, de mouvements des vêtements et de contacts réalistes avec la céramique. Résolvez progressivement vers l’image finale fournie, puis maintenez-la.

Un test pratique à trois images-clés : l’action change, mais l’interprète, le vase cobalt, le tablier, les étagères, les fenêtres et la direction gauche-droite restent lisibles.
Préserver la cohérence du personnage, de l’environnement, de la caméra et du son
Verrouiller l’identité indépendamment de la posture
Réutilisez une référence faciale canonique pour chaque essai. Laissez les images-clés modifier la posture, l’expression ou la distance sans redéfinir l’âge, la structure faciale, les cheveux ni les vêtements. Comparez le visage à l’image initiale, à la vue la plus large et à l’image finale.
Préserver la géométrie de l’environnement
Listez les relations stables, non une simple énumération de noms : fenêtre située derrière le banc, armoire bleue à droite de la caméra, lampe au-dessus de la table. Le guide de MiniMax H3 sur la cohérence de l’environnement explique comment distinguer les ancres de localisation des références liées au personnage et au mouvement.
Examinez les séquences animées, pas seulement les vignettes fixes. La structure de la serre, la table, les chaises, le feuillage, les lampes, la cruche, l’armoire et la lumière naturelle doivent rester reconnaissables au fur et à mesure du déroulement de l’action.
Préserver la logique de la caméra et du son
Gardez le sujet en mouvement dans une seule direction à l’écran, sauf si l’invite exige explicitement un changement motivé. Évitez de demander une rotation orbitale, un zoom, une grue ou un changement d’objectif entre des repères trop rapprochés. Lorsque le synchronisme sonore est critique, ancrez une courte indication audio au même instant que l’événement visuel, puis vérifiez l’intégralité de la séquence pour détecter des redémarrages de dialogue, des impacts répétés ou des changements brusques de ton ambiant.

Des plans larges, rapprochés et moyens peuvent conserver une impression de continuité si l’interprète, le violoncelle, la chaise, la pièce, la lumière des fenêtres et la direction de l’archet demeurent stables.
Utilisez le résultat animé pour évaluer le rythme des mains, la continuité de la caméra, le détail de l’instrument et la justesse du synchronisme entre le son et la performance visible.
Contrôle multi-images-clés ComfyUI contre Seedance Agent
Choisissez ComfyUI pour un contrôle au niveau des images
Le ComfyUI local convient aux créateurs nécessitant des indices d’images précis, des graphes réutilisables, un accès aux latents, ou des expérimentations avec des guides d’image et de son. Le coût en est la gestion des modèles, de VRAM, des versions de nœuds, des chemins, des métadonnées et des échecs.
Choisissez Seedance Agent pour la gestion de production
Seedance Agent part de l’objectif de production. Fournissez-lui le cahier des charges, les références, les moments clés requis, le format et les critères d’acceptation ; utilisez-le pour organiser le plan, comparer les résultats, valider les sections et relancer uniquement les éléments ayant échoué. Le flux de travail multishot reprise explique comment les prises approuvées deviennent des points de contrôle durables.
Adoptez une approche hybride pour les prises complexes
Planifiez la séquence et les rôles de référence dans Seedance Agent, aiguillez la prise critique en termes de synchronisation vers un graphe H3 local, puis renvoyez le résultat pour validation et assemblage. Le cahier des charges créatif reste lisible par l’équipe, tandis que la section complexe conserve ses contrôles au niveau des images. Commencez avec Seedance Agent lorsque la coordination de production prime sur la gestion des nœuds.
Corriger la dérive d’image, les morphoses brutales et les images-clés manquées
Une image-clé intermédiaire est ignorée
Vérifiez que le guide est bien connecté à la condition positive finale, que l’entrée VAE est présente et que frame_idx correspond bien à une image de la vidéo. Déplacez ensuite le guide plus loin des ancres voisines. Deux cibles incompatibles placées trop près l’une de l’autre ne laissent pas suffisamment de temps au modèle pour réaliser le passage.
La transition ressemble à une fondu-enchaîné
Réduisez le saut visuel. Conservez stables l’identité, l’arrière-plan, l’objectif et l’éclairage, en modifiant uniquement la pose ou la position de l’objet. Remplacez les formulations floues telles que « se transforme en douceur » par un trajet physique visible : s’ouvre, tourne, avance, se déploie, coule ou est placé.
Le visage change en plan large
Réutilisez l’image canonique d’identité, simplifiez l’image-clé intermédiaire et vérifiez si le visage est suffisamment grand pour porter des détails utiles. Corrigez un plan éloigné approuvé dans l’ensemble à l’aide du flux de travail H3 pour les visages à distance, plutôt que de rejeter une séquence stable.
Le graphe devient trop coûteux
Validez le déroulement temporel et la continuité à une résolution brouillon inférieure. N’effectuez le redimensionnement ou l’affinement qu’une fois le résultat approuvé. Suivez le coût par extrait approuvé, et non par génération, et modifiez une seule variable à chaque nouvelle exécution afin que le résultat suivant vous apporte un enseignement concret.
Conclusion
Un flux de travail fiable à plusieurs images-clés MiniMax H3 ne remporte pas la victoire en ajoutant le plus grand nombre d’images possible. Il repose sur un petit ensemble d’ancres compatibles, attribue à chaque référence un rôle précis, décrit le mouvement physique entre les états et examine le résultat audiovisuel complet. Utilisez ComfyUI lorsque le placement exact des images est une exigence créative ; utilisez Seedance Agent lorsque la tâche globale consiste à planifier, valider, assurer la continuité et effectuer des nouvelles exécutions sélectives. Commencez par un test à trois images-clés, approuvez le mouvement avant tout affinement, puis étendez la séquence sans sacrifier le travail déjà validé.
Prêt à essayer par vous-même ?
Mettez en pratique les étapes de ce guide dans Seedance et transformez vos prompts ou images en vidéos abouties en quelques minutes.
Crédits offerts à l'inscription. Forfaits à partir de $20/mois.
Articles associés
D'autres articles dans la même langue à lire ensuite.

Seedance 2.5 AI Film Cost : Établir le budget d’un court métrage avant le rendu
Estimez le coût d’un film Seedance 2.5 AI à partir des forfaits tarifaires, du nombre de prises, du taux de réessais, de la résolution, de l’audio et des travaux de finition, avant d’utiliser vos crédits.
Lire l'article
Comment maintenir une voix cohérente dans Seedance 2.5 pour chaque plan
Découvrez comment conserver la même voix sur tous les plans de Seedance 2.5 à l’aide de références audio propres, de verrous de locuteur, de modèles d’invite, de vérifications de synchronisation labiale et de Seedance Agent.
Lire l'article
Guide de workflow multishot reprise possible MiniMax H3
Créez un workflow MiniMax H3 qui enregistre les prises acceptées, reprend après une défaillance, relance un segment unique et préserve la continuité visuelle et audio.
Lire l'article