MiniMax H3 Ref2V frente a FL2VA: ¿Qué flujo de trabajo debería usar?

E
Emma Chen·11 min de lectura·Sep 5, 2026
Compartir en X
MiniMax H3 Ref2V frente a FL2VA: ¿Qué flujo de trabajo debería usar?

MiniMax H3 Ref2V frente a FL2VA no es una simple comparación de calidad. Se trata de dos familias de tareas diseñadas para distintos tipos de control. El nombre oficial de Ref2V es Ref2VA: utiliza imágenes, video y audio como referencias reutilizables para el sujeto, el estilo, el movimiento o la voz. FL2VA emplea cero, una o dos imágenes clave para definir dónde comienza una toma, dónde termina, o ambas cosas.

La pregunta práctica, por tanto, no es «¿qué punto de control (checkpoint) es mejor?», sino «¿qué debe permanecer fijo en esta toma?». Si la identidad o el producto deben conservarse ante una nueva cámara y un nuevo entorno, elija Ref2VA. Si la composición al inicio o al final debe ser exacta, elija FL2VA.

Resumen de IA

¿Cuál es la principal diferencia entre MiniMax H3 Ref2V y FL2VA?

Ref2VA incorpora referencias reutilizables de sujeto, estilo, video o audio en una toma recién compuesta. FL2VA anima desde un primer fotograma hacia un último fotograma, o entre ambos extremos.

¿Debo usar Ref2VA o FL2VA para garantizar la coherencia del personaje?

Use Ref2VA cuando el personaje deba aparecer en nuevas ubicaciones o ángulos de cámara. Use FL2VA cuando ya tenga la composición exacta que desea animar.

¿Pueden ambos modos MiniMax H3 generar audio?

Sí. Ambas familias de tareas generan video con audio estéreo nativo. Ref2VA es la opción más sólida cuando un fragmento de audio o el timbre vocal forman parte del paquete de referencias.

¿Qué modo es más sencillo para una primera prueba?

FL2VA suele ser más sencillo porque puede comenzar con una sola imagen y un único indicador (prompt). Ref2VA resulta valioso cuando un solo fotograma ya no contiene suficiente información sobre identidad, movimiento o audio.

Ref2VA frente a FL2VA: Regla de decisión breve

Quienes comparan estos modos suelen buscar una regla de decisión aplicable antes de cargar cientos de gigabytes de pesos (weights) o construir dos gráficos ComfyUI. Use esta regla: FL2VA preserva un punto final; Ref2VA preserva un rol de referencia.

Necesidad de producción Punto de partida preferible Razón
Animar una imagen estática finalizada FL2VA La imagen fuente es la composición exacta del primer o último fotograma
Conectar una apertura y un cierre diseñados FL2VA Dos imágenes clave definen ambos puntos finales
Colocar al mismo actor en una ubicación distinta Ref2VA La identidad puede separarse de la composición de la nueva toma
Reutilizar un producto en varias configuraciones publicitarias Ref2VA Varias vistas pueden describir geometría y materiales
Reutilizar voz, ambiente o pistas de movimiento Ref2VA El audio y el video pueden asignarse como referencias
Generar a partir de texto sin ninguna entrada visual Familia FL2VA La misma familia de puntos de control también cubre la generación de video a partir de texto

La salida H3 es 24 fps con audio estéreo nativo 32 kHz, y el flujo de trabajo base normalmente produce resolución 768p antes de cualquier etapa posterior de regeneración de alta resolución. Estas especificaciones comunes de salida no eliminan la diferencia en la condicionante. La elección del punto de control sigue determinando qué tipo de evidencia recibe el modelo.

Para una introducción más amplia a la asignación multimodal de referencias, consulte la guía de video de referencias de MiniMax H3.

Cuándo Ref2VA es la herramienta más adecuada

Quiere un sujeto, no una composición congelada

Ref2VA se entiende mejor como una función de «reparto». Proporcione pruebas de quién o qué debe seguir siendo reconocible, y luego describa una nueva toma. El modelo abierto acepta hasta nueve imágenes, hasta tres videos de referencia y hasta tres fragmentos de audio, con un máximo de doce archivos entre todos los tipos de referencia. Las duraciones de los videos y audios de referencia están limitadas, por lo que cada recurso debe tener una función clara.

No proporcione nueve retratos casi idénticos solo porque existan nueve ranuras disponibles. Un paquete útil de personaje podría contener una vista limpia del rostro, una vista del cuerpo en tres cuartos y un detalle de vestuario. Un paquete de producto podría incluir vistas frontal, lateral y detallada de su geometría. Una referencia de movimiento debería demostrar sincronización o movimiento de cámara que las imágenes fijas no pueden transmitir.

El mismo intérprete de cabello plateado sigue siendo reconocible en un callejón lluvioso, una toma general en el desierto y un primer plano brillante en el estudio

Observe la forma del rostro, el cabello plateado, la chaqueta de color cobalto y el pendiente a través de cambios importantes en lente, iluminación y entorno: el tipo de evidencia que debe medirse en una prueba de Ref2VA.

Asigne una única función a cada referencia

Un indicador (prompt) sólido para Ref2VA nombra cada entrada y especifica su función. «Imagen 1 define al actor», «Video 1 proporciona el movimiento de dolly» y «Audio 1 proporciona el timbre vocal» es más claro que pedirle al modelo que copie todo de todo. Cuando dos referencias entran en conflicto, indique cuál prevalece para el rostro, el vestuario, el movimiento, el entorno y el sonido.

MiniMax H3 Ref2VA resultado oficial de referencia-a-video

Resultado oficial de una plantilla Ref2VA: evalúe si la identidad y el estilo sobreviven al movimiento recién generado, en lugar de juzgar únicamente un único fotograma nítido.

Para una estructura lista para copiar, la guía de indicadores (prompting guide) de MiniMax H3 explica cómo separar las definiciones del sujeto de la toma objetivo y del paisaje sonoro.

Cuándo FL2VA es la herramienta más adecuada

Un solo fotograma ya contiene la respuesta

Elija FL2VA cuando la fuente no es meramente una inspiración, sino la toma en sí. Con una sola imagen, puede tratarse como el primer fotograma y animarse hacia adelante, o como el último fotograma y hacer que el movimiento llegue allí. Con dos imágenes, el modelo dispone de puntos finales visuales explícitos. Esto hace que FL2VA sea útil para revelados controlados, cortes por coincidencia (match cuts), bucles, apariciones de tarjetas de título, transformaciones de productos y acciones que deben finalizar en una pose prediseñada.

El error más común consiste en exigir un ángulo de cámara que el fotograma fuente no pueda soportar. Un retrato cercano no contiene la parte trasera de la chaqueta, la habitación completa ni la forma de caminar del actor. FL2VA puede inventar información faltante, pero cada invención genera un riesgo de discontinuidad. Si la tarea requiere una toma genuinamente nueva, en lugar de movimiento dentro de la composición suministrada, cambie a Ref2VA.

Una apertura coherente, un kickflip en el aire y un aterrizaje final junto al mismo tren dentro de una estación

Una evaluación útil de FL2VA verifica si el movimiento intermedio resulta creíble, mientras que la pose final, la geometría del tren, la dirección y la vestimenta siguen resolviéndose en el punto final planeado.

Diseñe puntos finales compatibles

Los fotogramas inicial y final deben coincidir en identidad del sujeto, vestimenta, geometría de la escena, relación de aspecto y movimiento plausible. Cambios importantes y sin explicación obligan al modelo a resolver varios problemas simultáneamente. Si la primera imagen muestra a un actor de pie en una estación y la última muestra una lente distinta, un atuendo diferente, otra estación del año y una ubicación distinta, la transición podría emplear toda su duración limitada en una transformación morfológica, en lugar de ejecutar la acción prevista.

MiniMax H3 official first-and-last-frame output

Un resultado oficial de FL2VA: observe la precisión de los puntos finales, la trayectoria entre fotogramas y si el audio nativo sigue la acción visual.

La guía de MiniMax H3 sobre primer y último fotograma aborda con mayor detalle el diseño de puntos finales.

Construya el flujo de trabajo correcto de ComfyUI

Cargue únicamente la familia de tareas necesaria

MiniMax H3 distribuye familias separadas de checkpoints para FL2VA y Ref2VA. No son dos etiquetas de menú vinculadas a un mismo grafo idéntico. FL2VA acepta texto más condiciones opcionales de primer y último fotograma. Ref2VA acepta referencias ordenadas de imágenes, vídeos y audio, además de un prompt que define cómo se relacionan dichas referencias con el objetivo.

Comience probando el grafo más pequeño. Para FL2VA, use un primer fotograma limpio, una breve instrucción de movimiento, una semilla fija y una duración corta. Añada un último fotograma únicamente después de que el resultado de un solo fotograma muestre un movimiento natural. Para Ref2VA, comience con una imagen de identidad y una descripción de la toma objetivo. Añada una segunda vista, un vídeo de movimiento o un clip de voz únicamente cuando el fallo indique qué evidencia falta.

La guía de configuración de MiniMax H3 para ComfyUI proporciona la ruta completa de instalación local. Guarde las familias de modelos en directorios claramente nombrados, para evitar que un cargador en caché haga que una prueba de Ref2VA parezca una prueba de FL2VA.

Describa el objetivo, no el inventario de referencias

Tras definir las referencias, describa el vídeo final en orden temporal. Especifique la cámara, la acción, el entorno, el diálogo, la ambientación y la música. No dedique todo el prompt a repetir lo visible en las imágenes de referencia. Ref2VA necesita una especificación nueva de la toma; FL2VA necesita una trayectoria de movimiento plausible entre lo ya visible.

Pruebe ambos modos con la misma consigna

Evalúe el fallo que realmente importa

Ejecute la misma consigna creativa en ambos modos únicamente cuando dicha consigna pueda expresarse de forma justa para ambos. Fije la duración, la relación de aspecto, la intención del prompt, la política de semillas y los criterios de revisión. Luego evalúe identidad, geometría de objetos, precisión de los puntos finales, calidad del movimiento, control de cámara, relevancia del audio y frecuencia de fotogramas utilizables.

Ref2VA debe ganar cuando el mismo sujeto deba sobrevivir a una nueva composición. FL2VA debe ganar cuando la composición inicial o final deba coincidir con la entrada. Un fotograma más nítido no compensa la presencia del actor equivocado; un actor coherente no compensa el fallo en la tarjeta final requerida.

La misma radio roja desgastada conserva su rejilla, su dial, su asa y sus proporciones en entornos de taller, apartamento y anuncio costero

Para productos, examine la geometría de la rejilla, la colocación del dial, la forma del asa, el desgaste de la pintura y el número de botones en distintos entornos, no solo el color general.

Cuente las salidas aceptadas, no los intentos de renderizado

El flujo de trabajo más económico es aquel que produce una toma aprobada con menos reintentos. Registre la causa de cada fallo. Si FL2VA cambia repetidamente la identidad durante un movimiento amplio de cámara, es probable que la consigna requiera Ref2VA. Si Ref2VA falla sistemáticamente al alcanzar una composición inicial o final exacta, proporcione ese punto final mediante FL2VA en lugar de añadir más adjetivos descriptivos.

Para secuencias más largas, incorpore el resultado aprobado al flujo de trabajo multi-fotograma clave de MiniMax H3 en vez de esperar que una sola generación resuelva toda la escena.

Use Seedance Agent cuando no desee dos pipelines locales

La ruta local basada en modelos abiertos ofrece un control profundo, pero el costo operativo aumenta cuando cada toma exige selección de checkpoints, limpieza de referencias, reestructuración de prompts, seguimiento de versiones y reintentos manuales. Precisamente ahí es donde Seedance Agent se integra de forma natural.Asigne al Agente el objetivo creativo y el paquete de referencias, luego revise el plan de tomas propuesto antes de invertir en las generaciones finales. Puede mantener los roles de referencia vinculados al brief, elegir una ruta de generación adecuada, organizar alternativas y volver a ejecutar únicamente la toma fallida, en lugar de obligarlo a reconstruir todo el grafo local. El beneficio útil no consiste en ocultar el modelo, sino en mantener juntos la decisión, la evidencia, la salida y el historial de aprobación.

Use Ref2VA local o FL2VA local cuando necesite un control reproducible a nivel de nodo y cuente con el hardware necesario para mantener ambas familias de tareas. Use el Agente alojado cuando desee pasar de referencias a tomas aprobadas sin tratar la gestión de checkpoints como una segunda producción. Puede iniciar el flujo de trabajo con Seedance Agent y comparar salidas reales antes de comprometerse con una secuencia más amplia.

Conclusión

MiniMax H3 Ref2V frente a FL2VA se vuelve sencillo una vez que define la invariante. Elija Ref2VA cuando el actor, el producto, el estilo, la indicación de movimiento o la voz deban conservarse en una toma recién compuesta. Elija FL2VA cuando un fotograma proporcionado sea exactamente la composición que debe animarse, o cuando dos fotogramas definan el inicio y el final requeridos. Construya el grafo más pequeño posible, asigne un rol a cada referencia, pruebe según la tasa de aceptación de salidas y cambie de modo cuando el fallo le indique que está protegiendo lo incorrecto. Si desea la misma planificación con referencias, selección de modelo, revisión y lógica de reinicio parcial sin tener que mantener dos pipelines locales, pruebe el flujo de trabajo Seedance Agent.

¿Listo para probarlo tú mismo?

Pon en práctica los pasos de esta guía con Seedance y convierte prompts o imágenes en videos pulidos en minutos.

Créditos gratis al registrarte. Planes desde $20/mes.