- Blog
- MiniMax H3 Primer y Último Fotograma: Cómo controlar ambos extremos de su video generado por IA
MiniMax H3 Primer y Último Fotograma: Cómo controlar ambos extremos de su video generado por IA

Resumen de la IA
¿Qué es el modo «primer y último fotograma» de MiniMax H3?
MiniMax H3 FLF2V toma una imagen inicial y una imagen final, y genera el movimiento visual y el audio estéreo sincronizado entre ambas. Usted define ambos extremos, mientras que la indicación (prompt) guía el recorrido.
¿En qué se diferencia el modo «primer y último fotograma» del modo «imagen a video»?
El modo «imagen a video» fija únicamente el fotograma inicial. El modo «primer y último fotograma» fija ambos extremos, por lo que el modelo debe llegar a una composición final específica, en lugar de inventarla.
¿Qué formatos y resoluciones de imagen acepta MiniMax H3 FLF2V?
Las herramientas H3 alojadas aceptan imágenes web comunes, como JPEG y PNG; la relación de aspecto de la salida sigue la de la primera imagen. Asegúrese de que ambas imágenes tengan las mismas dimensiones y relación de aspecto antes de subirlas.
¿Listo para probarlo tú mismo?
Créditos gratis al registrarte. Planes desde $20/mes.
¿Puedo usar el modo «primer y último fotograma» de MiniMax H3 sin una GPU local?
Sí. Los puntos finales H3 alojados en la nube realizan la generación de forma remota, mientras que los usuarios locales pueden ejecutar el flujo de trabajo de pesos abiertos en ComfyUI si disponen del hardware adecuado.
Qué hace realmente MiniMax H3 Primer y Último Fotograma
El video «primer y último fotograma» de MiniMax H3 (FLF2V) trata dos imágenes fijas como anclajes visuales rígidos. La primera imagen fija el fotograma cero. La última imagen fija el destino final. Entre ambos, H3 planifica el movimiento, el comportamiento de la cámara, los cambios de iluminación, las transformaciones de objetos y el audio estéreo nativo. Una flor cerrada puede abrirse hasta convertirse en una flor desplegada, una calle al mediodía puede evolucionar hacia la hora azul, o una caja de producto sellada puede terminar completamente abierta.
El modo «imagen a video» ordinario tiene solo el primer ancla, por lo que el fotograma final puede desviarse en pose, encuadre, color o geometría del producto. FLF2V reduce esa incertidumbre. No se limita a un fundido cruzado: el modelo sintetiza una ruta plausible entre dos composiciones. Esto refuerza considerablemente el control sobre los extremos, aunque la parte intermedia siga dependiendo de la compatibilidad entre las imágenes y la indicación.

Un par real de primer y último fotograma tomado de la documentación oficial de la API de MiniMax. Fotogramas coincidentes en relación 16:9 ofrecen al modelo una trayectoria limpia desde el retrato inicial hasta el retrato final.
Casos de uso — Cuándo dos fotogramas anclados superan a uno solo
Dos anclajes resultan especialmente útiles cuando la toma final importa tanto como la inicial:
| Caso de uso | Primer fotograma | Último fotograma | Qué planifica H3 |
|---|---|---|---|
| Revelado de producto | Paquete cerrado | Producto totalmente expuesto | Acción de apertura, traspaso, énfasis visual y sonoro |
| Transición temporal | Calle al amanecer | Skyline nocturno | Cambios de luz, tráfico, cielo y ambiente |
| Acción de personaje | Pose de pie | Aterrizaje controlado | Trayectoria corporal, movimiento de telas, impacto y seguimiento de cámara |
| Puente entre viñetas | Toma aprobada A | Toma aprobada B | Toma conectiva entre dos paneles |
| Anuncio «antes/después» | Habitación original | Reforma finalizada | Transformación de materiales y distribución espacial |
El ejemplo oficial de H3 que aparece a continuación es un clip generado, no una ilustración conceptual. Observe cómo la máscara fija de prismáticos y los acentos rojos repetidos brindan al modelo fuertes pistas de continuidad, mientras la cámara explora los momentos planificados.
Cómo usar FLF2V — Guía paso a paso mediante la API de MiniMax y Seedance
- Prepare dos imágenes compatibles. Recorte ambas al mismo ratio de aspecto y dimensiones. Mantenga la escala del sujeto, el eje de la cámara y la geometría principal lo suficientemente cercanas para lograr una transición creíble.
- Describa el movimiento, no la apariencia. Las imágenes ya definen al sujeto y su aspecto. Redacte la acción, el ritmo, el movimiento de cámara y las pistas auditivas que deben conectarlas.
- Envíe los dos fotogramas extremos. Una solicitud a H3 alojado usa la imagen inicial más un campo «imagen final»; en un flujo de trabajo basado en navegador, siga la guía de Seedance sobre primer y último fotograma y cargue los dos fotogramas en orden.
- Genere una prueba corta. Comience con la duración más breve útil. Revise la parte intermedia para detectar desviaciones de identidad, disoluciones no deseadas, aparición repentina de objetos (popping) y audio que contradiga la acción.
- Modifique una variable a la vez. Si la trayectoria resulta incorrecta, simplifique primero la indicación de movimiento antes de reemplazar imágenes de extremos que ya funcionan bien.
Si solo necesita animar una imagen de producto o personaje ya aprobada y no le importa el resultado exacto del fotograma final, el espacio de trabajo más sencillo «Imagen a video» de Seedance suele ser más rápido.
Ejecutar Primer y Último Fotograma en ComfyUI
Actualice ComfyUI antes de construir el grafo; este flujo de trabajo supone la versión 0.30.0 o posterior. Cargue el modelo de difusión H3 FL2VA, el codificador de texto Qwen3-VL y el VAE compatibles, luego agregue el nodo de condicionamiento nativo MiniMaxH3ImageToVideo. Conecte las dos entradas de imagen decodificadas a first_frame y last_frame, establezca el ancho y alto objetivo, y seleccione una duración válida en la cuadrícula de fotogramas 17k+5 de H3. Una prueba común de cinco segundos corresponde a 124 fotogramas a 24 fps.
Mantenga ambas imágenes de entrada con la misma relación de aspecto que el latente. El muestreador distilado por guía de H3 utiliza una guía (guidance) de 1; aumentar la CFG convencional puede reducir la estabilidad en lugar de mejorarla. La configuración completa de MiniMax H3 para ComfyUI cubre los archivos base y el orden del grafo.
Para iteraciones más rápidas, agregue un adaptador Turbo compatible y pruebe la inferencia de cuatro pasos antes de incrementar el número de pasos. La guía de MiniMax H3 Turbo LoRA muestra la ubicación del cargador y las intensidades recomendadas. Turbo ayuda a previsualizar la transición, pero una pasada final de alta calidad podría seguir beneficiándose del flujo de trabajo base.
Indicaciones de escritura que funcionan con dos fotogramas fijos
Las imágenes finales ya responden a la pregunta de qué es visible. Una indicación útil para FLF2V explica cómo se desplaza la toma entre ellas: acción del sujeto, velocidad, trayectoria de la cámara, cambio ambiental y sonido. Evite repetir todos los detalles visuales, pues eso podría entrar en conflicto con los fotogramas suministrados. Para una sintaxis más amplia y un vocabulario cinematográfico más completo, consulte la guía de indicaciones para MiniMax H3.
Revelación de producto: La cámara realiza una órbita lenta de 30 grados mientras la tapa se levanta en un único movimiento continuo. Un destello suave recorre la superficie metálica; sin cortes ni fundidos. Movimiento preciso de las bisagras, ambiente de estudio silencioso, clic sutil del cierre.
Transición de día a noche: Mantenga fija la posición de la cámara. El tiempo avanza de forma fluida desde una cálida tarde hasta la hora azul; las luces prácticas se encienden una a una, el tráfico continúa de forma natural y el ambiente urbano distante aumenta ligeramente en volumen.
Aterrizaje de un personaje: El personaje cae dentro del encuadre, gira una vez y aterriza en la postura final agachada. La cámara inclina hacia abajo y se detiene suavemente al impacto. El abrigo y el cabello siguen el movimiento con inercia realista; un único sonido limpio de aterrizaje.
Estas indicaciones especifican dirección y ritmo sin volver a describir la vestimenta fija, la ubicación o el producto. Utilice lenguaje explícito de continuidad —por ejemplo, toma continua, sin corte, conservar el logotipo— únicamente cuando su ausencia arruine la transición.
Límites, problemas conocidos y soluciones prácticas
| Problema | Por qué ocurre | Solución práctica |
|---|---|---|
| Recorte o salto en los fotogramas finales | Las imágenes usan proporciones o escalas distintas del sujeto | Igualar el tamaño del lienzo; alinear el horizonte, la línea visual y el centro del sujeto antes de subir las imágenes |
| Morfología en el centro | Los dos fotogramas implican un cambio geométrico imposible | Reducir la distancia visual o añadir un paso intermedio de generación |
| Llegada débil al final | Demasiadas acciones compiten por una duración corta | Mantener una acción principal y reservar el último segundo para el asentamiento |
| Fundido cruzado no deseado | La indicación describe una transformación pero no un movimiento físico | Nombrar el mecanismo: se abre, rota, despliega, camina o la cámara realiza un barrido (pan) |
| Audio desincronizado con el ritmo | El audio se genera junto con el movimiento, no sincronizado por fotograma | Solicitar una única pista sonora simple y reemplazar el audio crítico en posproducción |
| Desajuste de duración | El H3 local sigue la cuadrícula de fotogramas 17k+5 |
Usar cantidades válidas como 124, 209 o 294 fotogramas a 24 fps |
La causa principal de fallos es pedirle a dos imágenes que describan mundos diferentes. Una fotografía de producto centrada en estudio no puede convertirse de forma natural en una escena de acción exterior amplia mediante un solo clip corto, sin introducir geometría inventada. FLF2V funciona mejor cuando los fotogramas finales difieren en estado, postura, iluminación o posición de la cámara, pero aún comparten un sujeto y un espacio coherentes.
Conclusión
El modo «primer y último fotograma» de MiniMax H3 es la opción adecuada cuando un video debe comenzar y terminar en imágenes aprobadas: iguale los dos fotogramas, describa únicamente el movimiento entre ellos, pruebe una transición corta y simplifique cualquier elemento que se distorsione o salte. Use la generación en la nube cuando priorice la velocidad, o ComfyUI cuando necesite control local; y cuando esté listo para convertir dos fotogramas clave en un clip final para una campaña sin configurar una GPU local, cree su próximo video con Seedance →.
¿Listo para probarlo tú mismo?
Pon en práctica los pasos de esta guía con Seedance y convierte prompts o imágenes en videos pulidos en minutos.
Créditos gratis al registrarte. Planes desde $20/mes.
Artículos relacionados
Más publicaciones en el mismo idioma que quizá quieras leer después.

Las mejores configuraciones de MiniMax H3 para calidad, velocidad y audio en 2026
Usa las mejores configuraciones de MiniMax H3 para resolución, pasos, muestreador, programador, guía, audio y todos los modos de generación H3 en ComfyUI o en la nube.
Leer artículo
MiniMax H3: 30 vs. 50 pasos — ¿Qué cambia realmente en calidad y velocidad?
Compara MiniMax H3 con 20, 30 y 50 pasos en cuanto a detalle de imagen, tiempo de generación, calidad de audio, velocidad de Turbo LoRA y la configuración óptima para cada flujo de trabajo.
Leer artículo
Entrenamiento de LoRA para MiniMax H3: Guía completa para ajuste fino de estilos de vídeo personalizados
Preparar un conjunto de datos de vídeo MiniMax H3, elegir entrenamiento T2V, I2V, first-last-frame o Ref2VA, ajustar el rango y la tasa de aprendizaje, y utilizar la LoRA resultante en flujos de trabajo locales o en la nube.
Leer artículo