- Blog
- Tutoriel Wan Animate 2 : mode Move, mode Mix et guide du flux de travail ComfyUI
Tutoriel Wan Animate 2 : mode Move, mode Mix et guide du flux de travail ComfyUI

Aperçu IA
Qu’est-ce que Wan Animate 2 et que peut-il faire ?
Wan Animate 2 est un système open source d’animation de personnages basé sur Wan 2.2. Il transfère les mouvements du corps entier, les expressions faciales et les mouvements des lèvres depuis une vidéo conductrice vers un personnage de référence, via le mode Move ou le mode Mix.
Quelle est la différence entre le mode Move et le mode Mix dans Wan Animate 2 ?
Le mode Move anime un personnage statique et laisse le modèle générer l’arrière-plan environnant. Le mode Mix remplace la personne présente dans la vidéo conductrice tout en conservant la scène d’origine, l’arrière-plan et la piste audio.
Puis-je exécuter Wan Animate 2 localement dans ComfyUI ?
Oui. Le flux de travail utilise les poids Wan 2.2 Animate, WanVideoAnimateEmbeds, un échantillonneur (sampler) et une VAE. Choisissez le format bf16 lorsque la mémoire le permet, ou int8-convrot pour une configuration locale plus légère.
Prêt à essayer par vous-même ?
Crédits offerts à l'inscription. Forfaits à partir de $20/mois.
Quelles entrées Wan Animate 2 requiert-il ?
Les deux modes nécessitent une image de référence et une vidéo conductrice. Des recadrages précis du visage améliorent la fidélité de l’identité ; le mode Mix bénéficie en outre de trames d’arrière-plan propres et d’un masque SAM2 fiable de la personne.
Ce que fait réellement Wan Animate 2 — et pourquoi il se distingue
Les modèles classiques image-à-vidéo inventent le mouvement à partir d’une image fixe et d’un prompt. Wan Animate 2, quant à lui, traite une performance réelle comme une directive structurée : la vidéo conductrice fournit la pose, le rythme, l’expression faciale et les mouvements buccaux, tandis que l’image de référence fournit l’identité du personnage. Cela le rend utile lorsque la performance compte autant que l’apparence.
Cela diffère également des générateurs contrôlés par des points extrêmes (endpoint-controlled generation). Un flux de travail « première trame / dernière trame » définit où commence et où se termine un plan, mais ne reproduit pas chaque instant intermédiaire. Consultez le guide MiniMax H3 première trame / dernière trame si la trame cible importe davantage que le transfert de performance.
Cette séquence à trois volets maintient simultanément visibles l’image de référence statique, la performance conductrice et le résultat généré. Elle constitue un contrôle qualité plus utile qu’une simple trame polie, car elle permet de comparer directement le rythme des gestes et la fidélité de l’identité.
Mode Move contre mode Mix — Choisir le bon mode
Les deux modes transfèrent une performance, mais résolvent des problèmes de production différents. Utilisez ce tableau décisionnel avant de créer des masques ou de préparer des trames supplémentaires :
| Décision | Mode Move | Mode Mix |
|---|---|---|
| Entrées | Image de référence + vidéo conductrice | Image de référence + vidéo conductrice |
| Arrière-plan | Régénéré par le modèle | L’arrière-plan vidéo d’origine est préservé |
| Usage optimal | Animation d’action de personnage et d’image | Remplacement d’une personne au sein d’une scène existante |
| Règle synthétique | « Faire bouger l’image » | « Remplacer la personne dans la vidéo » |
Choisissez le mode Move lorsque le personnage et son mouvement constituent le cœur créatif, et que l’environnement peut changer. Optez pour le mode Mix lorsque la mise en place, les accessoires, l’éclairage, le mouvement de caméra et le son fonctionnent déjà correctement dans la séquence source. Pour une version axée navigateur de la même idée, essayez d’abord le flux de travail de contrôle du mouvement avant de vous engager dans un graphe local.
Cet exemple illustre pourquoi la silhouette et les proportions corporelles sont essentielles. La vidéo conductrice et le personnage peuvent paraître totalement différents, mais le résultat reste lisible dès lors que l’image de référence présente une pose claire du corps entier et que la vidéo conductrice reste centrée dans le cadre.
Ce dont vous avez besoin avant de commencer — Entrées et fichiers de modèle
Préparez les ressources avant d’ouvrir ComfyUI. Un jeu d’entrées propre évite bien plus d’échecs que l’ajout ultérieur d’étapes d’échantillonnage.
- Vidéo conductrice : un seul sujet visible, cadrage stable, membres bien visibles et mouvements faciaux intentionnels. Supprimez les temps morts avant l’export.
- Image de référence : une image nette du personnage en pied ou en trois-quarts, avec mains et pieds visibles, et visage non obstrué.
- Recadrages du visage : des recadrages serrés des visages de référence et de conducteur, afin d’améliorer l’alignement de l’identité et des expressions.
- Masque SAM2 pour le mode Mix : un masque solide de la personne, sans trous autour des cheveux, des mains ou des vêtements en mouvement.
- Trames d’arrière-plan pour le mode Mix : des prises propres de la séquence originale ; utilisez-les chaque fois que l’acteur remplacé révèle des zones auparavant masquées.
- Poids Wan 2.2 Animate : le format bf16 offre le chemin de pleine précision le plus propre ; int8-convrot réduit la pression mémoire, avec un éventuel compromis sur la qualité.
Le matériel, la quantification et le temps de décodage continuent de façonner l’expérience locale. Les compromis décrits dans notre comparaison LTX 2.5 vs MiniMax H3 constituent une liste de vérification utile pour décider d’exécuter localement ou d’utiliser un flux de travail hébergé.

Le diagramme officiel d’architecture montre comment les jetons issus de l’image de référence, de la vidéo de référence et de la vidéo cible entrent dans le pipeline d’animation.
Flux de travail étape par étape dans ComfyUI1. Charger les poids de Wan 2.2 Animate. Sélectionnez le format bf16 pour la qualité lorsque la mémoire vidéo (VRAM) le permet, ou la version int8-convrot pour un graphe plus léger. Vérifiez que le VAE et l’encodeur de texte correspondent au flux de travail.
- Connectez
WanVideoAnimateEmbeds. Fournissez-lui l’identité de référence, la séquence de poses du conducteur (driver), les recadrages du visage et le masque SAM2. Le mode Mix nécessite le masque le plus propre, car l’arrière-plan d’origine doit subsister après le remplacement. - Ajustez les dimensions du conducteur. Définissez la largeur, la hauteur et
num_framesselon la vidéo du conducteur préparée. Utilisez des dimensions divisibles par 16 et testez d’abord un court segment. - Configurez
WanVideoSampler. Ajoutez une invite de scène directe, toute LoRA compatible, l’échantillonneur (sampler), le planificateur (scheduler), la graine (seed) et le nombre d’étapes. L’invite doit décrire l’apparence et l’environnement, sans entrer en conflit avec les mouvements du conducteur. - Choisissez Mix ou Move. Acheminez vers Mix avec les images d’origine de la scène et de l’arrière-plan ; acheminez vers Move lorsque le modèle doit reconstruire entièrement l’environnement autour de la référence animée.
- Décodez et enregistrez. Examinez le premier résultat à pleine taille, puis comparez le visage, les doigts, les bords du masque, le contact avec le sol et la synchronisation labiale par rapport au conducteur avant d’augmenter la durée ou la résolution.
Si vous souhaitez valider le personnage et le cadrage sans installer de modèles, commencez par le générateur référence-vers-vidéo, puis réutilisez la paire d’entrées approuvée dans ComfyUI.
Obtenir de meilleurs résultats — Corrections courantes et conseils
- Dérive de l’arrière-plan : fournissez des images propres de l’arrière-plan en mode Mix, et utilisez un masque SAM2 bien défini. Un flou excessif (feathering) peut créer un halo autour de l’acteur.
- Dérive du visage : utilisez des recadrages précis du visage, un éclairage uniforme et un angle de référence proche de celui du conducteur. Évitez que les mains ne couvrent le visage lors du premier test.
- Inadéquation de résolution : assurez une correspondance exacte entre la largeur, la hauteur et
num_framesdu conducteur. Redimensionnez une seule fois avant le graphe, plutôt que sur plusieurs nœuds. - Mouvements labiaux peu naturels : choisissez un conducteur dont la bouche est bien visible, avec des syllabes claires et un flou de mouvement limité. Des angles de profil extrêmes réduisent les détails utiles des lèvres.
- Itérations lentes : appliquez une LoRA de distillation pas-à-pas (step-distillation) lightx2v compatible, et commencez avec un court extrait. Moins d’étapes sont précieuses pour les tests, mais comparez toujours l’exécution finale avec la référence non distillée.
Modifiez une seule variable à la fois. Une graine fixe, un court segment du conducteur et un jeu d’entrées sauvegardé transforment chaque nouvelle tentative en une comparaison utile, plutôt qu’en une nouvelle expérience.
Cas d’usage — Ce que vous pouvez créer avec Wan Animate 2
- Animateur IA ou humain numérique — Move : animez un portrait net d’un présentateur à partir d’une performance enregistrée, lorsque le décor peut être régénéré autour de l’animateur.
- Remplacement de mannequin en commerce électronique — Mix : conservez la mise en scène du produit et le mouvement de caméra tout en remplaçant l’interprète par un personnage de campagne.
- Animation d’IP personnalisée — Move : transférez les gestes humains et la synchronisation faciale à une mascotte, une illustration ou un personnage 3D stylisé.
- Danse et action UGC — Move : transformez une image approuvée unique en une courte vidéo sociale centrée sur le mouvement, sans avoir à animer manuellement les poses clés.
- Remplacement par lot de personnages publicitaires — Mix : préservez la même édition, le même lieu, les mêmes accessoires et la même piste audio tout en adaptant le talent à l’écran pour plusieurs variantes.
Pour les personnages de marque récurrents, la cohérence du jeu de données importe davantage que l’ajout de séquences aléatoires. Les bonnes pratiques de préparation et de validation décrites dans notre guide d’entraînement LoRA MiniMax H3 s’appliquent très bien aux projets d’animation personnalisés.
Conclusion
La règle la plus simple est la suivante : Move = animer l’image ; Mix = remplacer la personne dans la vidéo. Commencez avec une référence propre et un conducteur court, verrouillez les dimensions et les masques, puis n’augmentez l’échelle qu’après avoir assuré la stabilité de l’identité et du mouvement. Si vous souhaitez bénéficier du même flux de travail piloté par référence sans gérer localement les poids et les nœuds, créez votre prochaine vidéo IA sur Seedance →.
Prêt à essayer par vous-même ?
Mettez en pratique les étapes de ce guide dans Seedance et transformez vos prompts ou images en vidéos abouties en quelques minutes.
Crédits offerts à l'inscription. Forfaits à partir de $20/mois.
Articles associés
D'autres articles dans la même langue à lire ensuite.

Avis sur LTX 2.5 : vitesse, génération multi-plan et comparaison avec MiniMax H3
Un avis honnête sur LTX 2.5 couvrant la vitesse, la génération native de vidéos multi-plan, la configuration dans ComfyUI, les poids ouverts, la qualité d’image et une comparaison directe avec MiniMax H3.
Lire l'article
Entraînement LoRA pour MiniMax H3 : Guide complet du fine-tuning pour des styles vidéo personnalisés
Préparez un jeu de données vidéo MiniMax H3, choisissez l’entraînement T2V, I2V, first-last-frame ou Ref2VA, ajustez le rang et le taux d’apprentissage, puis utilisez le LoRA résultant dans des flux de travail cloud ou locaux.
Lire l'article
MiniMax H3 : 30 contre 50 étapes — Ce qui change réellement en termes de qualité et de vitesse
Comparez MiniMax H3 à 20, 30 et 50 étapes pour le détail des images, le temps de génération, la qualité audio, la vitesse Turbo LoRA, ainsi que le réglage optimal pour chaque flux de travail.
Lire l'article