Tutorial de Wan Animate 2: modo Move, modo Mix y guía del flujo de trabajo en ComfyUI

E
Emma Chen·8 min de lectura·Aug 19, 2026
Compartir en X
Tutorial de Wan Animate 2: modo Move, modo Mix y guía del flujo de trabajo en ComfyUI

Resumen de IA

¿Qué es Wan Animate 2 y qué puede hacer?

Wan Animate 2 es un sistema de animación de personajes de código abierto basado en Wan 2.2. Transfiere movimiento corporal completo, expresión facial y movimiento labial desde un video controlador a un personaje de referencia mediante los modos Move o Mix.

¿Cuál es la diferencia entre el modo Move y el modo Mix en Wan Animate 2?

Move anima un personaje estático y permite que el modelo genere el entorno de fondo. Mix sustituye a la persona en un video controlador manteniendo intacta la escena original, el fondo y el audio.

¿Puedo ejecutar Wan Animate 2 localmente en ComfyUI?

Sí. El flujo de trabajo utiliza los pesos de Wan 2.2 Animate, WanVideoAnimateEmbeds, un muestreador y un VAE. Elige bf16 cuando la memoria lo permita, o int8-convrot para una configuración local más ligera.

¿Listo para probarlo tú mismo?

Créditos gratis al registrarte. Planes desde $20/mes.

Prueba Seedance gratis

¿Qué entradas requiere Wan Animate 2?

Ambos modos necesitan una imagen de referencia y un video controlador. Recortes faciales fiables mejoran la identidad; además, el modo Mix se beneficia de fotogramas de fondo limpios y una máscara precisa de persona con SAM2.

Qué hace realmente Wan Animate 2 — y por qué es distinto

Los modelos ordinarios de imagen a video inventan el movimiento a partir de una imagen estática y un indicador (prompt). Wan Animate 2, en cambio, trata una actuación real como una guía estructurada: el video controlador aporta la postura, el ritmo, la expresión facial y el movimiento bucal, mientras que la imagen de referencia aporta la identidad del personaje. Esto lo hace útil cuando la actuación importa tanto como la apariencia.

Esto también difiere de la generación controlada por puntos finales. Un flujo de trabajo de primer y último fotograma define dónde comienza y termina una toma, pero no reproduce cada detalle intermedio. Consulta la guía de MiniMax H3 para primer y último fotograma cuando el fotograma final importa más que la transferencia de actuación.

Oficial Wan Animate 2 · referencia, controlador y actuación generada

El clip de tres paneles mantiene visibles simultáneamente la imagen de referencia estática, la actuación de control y el resultado generado. Es una verificación de calidad más útil que un solo fotograma pulido, porque permite comparar directamente el ritmo gestual y la identidad.

Modo Move frente a modo Mix — Elegir el adecuado

Ambos modos transfieren una actuación, pero resuelven distintos problemas de producción. Usa esta tabla de decisión antes de crear máscaras o preparar fotogramas adicionales:

Decisión Modo Move Modo Mix
Entradas Imagen de referencia + video controlador Imagen de referencia + video controlador
Fondo Regenerado por el modelo Se conserva el fondo original del video
Uso óptimo Acción del personaje y animación de imágenes Sustitución de persona dentro de una escena existente
Regla en una línea «Hacer que la imagen se mueva» «Reemplazar a la persona en el video»

Elige Move cuando el personaje y su movimiento son el núcleo creativo y el entorno puede cambiar. Elige Mix cuando la composición, los accesorios, la iluminación, el movimiento de cámara y el sonido ya funcionan correctamente en el clip original. Para una versión orientada al navegador del mismo concepto, prueba el flujo de trabajo de control de movimiento antes de comprometerte con un grafo local.

Oficial Wan Animate 2 · transferencia de movimiento estilizada de personajes

Este ejemplo muestra por qué importan la silueta y la proporción corporal. El controlador y el personaje pueden parecer completamente distintos, pero el resultado sigue siendo legible si la referencia tiene una postura clara de cuerpo completo y el controlador permanece dentro del encuadre.

Qué necesitas antes de comenzar — Entradas y archivos del modelo

Prepara los recursos antes de abrir ComfyUI. Un conjunto de entradas limpio evita más fallos que añadir pasos de muestreo posteriormente.

  • Video controlador: un único sujeto visible, encuadre estable, extremidades bien definidas y movimientos faciales deliberados. Recorta los tiempos muertos antes de exportar.
  • Imagen de referencia: una imagen nítida de cuerpo completo o tres cuartos del personaje, con manos y pies visibles y rostro sin obstrucciones.
  • Recortes faciales: recortes cercanos de los rostros de la referencia y del controlador para lograr una alineación más fuerte de identidad y expresión.
  • Máscara SAM2 para Mix: una máscara sólida de la persona, sin huecos alrededor del cabello, las manos ni la ropa en movimiento.
  • Fotogramas de fondo para Mix: planos limpios tomados del plano original; úsalos siempre que el actor reemplazado revele áreas previamente ocultas.
  • Pesos de Wan 2.2 Animate: bf16 ofrece la ruta de precisión completa más limpia; int8-convrot reduce la presión sobre la memoria con una posible compensación en calidad.

El hardware, la cuantización y el tiempo de decodificación siguen influyendo en la experiencia local. Las compensaciones descritas en nuestra comparación entre LTX 2.5 y MiniMax H3 constituyen una lista de verificación útil para decidir si ejecutar localmente o usar un flujo de trabajo alojado.

Estructura del modelo Wan Animate 2 que muestra la condicionamiento directo de imagen y video

El diagrama oficial de arquitectura muestra cómo entran los tokens de la imagen de referencia, el video de referencia y el video objetivo en la tubería de animación.

Flujo de trabajo paso a paso en ComfyUI1. Cargue los pesos de Wan 2.2 Animate. Seleccione bf16 para mayor calidad cuando la VRAM lo permita, o bien la compilación int8-convrot para un grafo más ligero. Asegúrese de que el VAE y el codificador de texto coincidan con el flujo de trabajo.

  1. Conecte WanVideoAnimateEmbeds. Proporcione como entradas la identidad de referencia, la secuencia de poses del conductor (driver), los recortes faciales y la máscara SAM2. El modo Mix requiere la máscara más limpia posible, ya que el fondo original debe sobrevivir al reemplazo.
  2. Ajuste las dimensiones del conductor. Establezca width, height y num_frames según el video del conductor previamente preparado. Use dimensiones divisibles por 16 y pruebe primero un segmento corto.
  3. Configure WanVideoSampler. Agregue un prompt directo de escena, cualquier LoRA compatible, el muestreador (sampler), el planificador (scheduler), la semilla (seed) y el número de pasos (steps). El prompt debe describir la apariencia y el entorno, en lugar de competir con la acción del conductor.
  4. Elija Mix o Move. Enrute mediante Mix junto con los fotogramas originales de la escena y el fondo; enrute mediante Move cuando el modelo deba reconstruir el entorno alrededor de la referencia animada.
  5. Decodifique y guarde. Inspeccione el primer resultado a tamaño completo, luego compare rostro, dedos, bordes de la máscara, contacto con el suelo y sincronización labial frente al conductor antes de aumentar la duración o la resolución.

Si desea validar el personaje y el encuadre sin instalar modelos, comience con el generador de video a partir de referencia y luego transfiera el par de entradas aprobadas a ComfyUI.

Conseguir mejores resultados — Soluciones comunes y consejos

  • Deriva del fondo: proporcione fotogramas de fondo limpios en modo Mix y use una máscara SAM2 sólida. Suavizar (feathering) de forma demasiado agresiva puede generar un halo alrededor del actor.
  • Deriva facial: use recortes faciales nítidos, iluminación uniforme y un ángulo de referencia cercano al del conductor. Evite que las manos cubran el rostro durante la primera prueba.
  • Desajuste de resolución: asegúrese de que width, height y num_frames coincidan exactamente con los del conductor. Redimensione una sola vez antes del grafo, no en varios nodos.
  • Labios poco naturales: elija un conductor con la boca visible, sílabas claras y desenfoque por movimiento limitado. Ángulos extremos de perfil reducen los detalles útiles de los labios.
  • Iteraciones lentas: aplique una LoRA de distilación por pasos (step-distillation) lightx2v compatible y comience con un clip corto. Menos pasos son valiosos para pruebas, pero siempre compare la ejecución final con la línea base sin distilación.

Cambie una variable a la vez. Una semilla fija, un segmento corto del conductor y un conjunto de entradas guardado convierten cada reintento en una comparación útil, en lugar de un nuevo experimento.

Casos de uso — Qué puede construir con Wan Animate 2

  1. Presentador IA o humano digital — Move: anime un retrato limpio de un presentador a partir de una actuación grabada, cuando el escenario pueda regenerarse alrededor del presentador.
  2. Reemplazo de modelo en comercio electrónico — Mix: conserve la disposición del producto y el movimiento de cámara mientras sustituye al intérprete por un personaje de campaña.
  3. Animación de IP personalizada — Move: transfiera gestos humanos y sincronización facial a una mascota, ilustración o personaje 3D estilizado.
  4. Baile y acción generado por usuarios (UGC) — Move: convierta una imagen aprobada en un clip social guiado por movimiento, sin necesidad de animar manualmente poses clave.
  5. Reemplazo por lotes de personajes publicitarios — Mix: conserve la misma edición, ubicación, accesorios y audio, adaptando únicamente al talento en pantalla para múltiples variantes.

Para personajes de marca recurrentes, la coherencia del conjunto de datos importa más que agregar material aleatorio. Las prácticas de preparación y validación descritas en nuestra guía de entrenamiento de LoRA para MiniMax H3 se trasladan muy bien a proyectos personalizados de animación.

Conclusión

La regla más sencilla es: Move = animar la imagen; Mix = reemplazar a la persona en el video. Comience con una referencia limpia y un conductor corto, bloquee las dimensiones y las máscaras, y solo amplíe la escala después de que la identidad y el movimiento permanezcan estables. Si desea el mismo flujo de trabajo guiado por referencias sin tener que mantener pesos y nodos locales, cree su próximo video IA en Seedance →.

¿Listo para probarlo tú mismo?

Pon en práctica los pasos de esta guía con Seedance y convierte prompts o imágenes en videos pulidos en minutos.

Créditos gratis al registrarte. Planes desde $20/mes.