MiniMax H3 ComfyUI: Guía completa de configuración para flujos de trabajo T2V, I2V y R2V

E
Emma Chen·9 min de lectura·Aug 17, 2026
Compartir en X
MiniMax H3 ComfyUI: Guía completa de configuración para flujos de trabajo T2V, I2V y R2V

Resumen de IA

¿Se puede ejecutar MiniMax H3 localmente en ComfyUI?

Sí. MiniMax H3 tiene pesos abiertos y soporte nativo en ComfyUI 0.30.0 o posterior. Cargue una plantilla H3, descargue el modelo de difusión requerido, el codificador de texto y los dos VAE, y luego ejecute el flujo en su propio hardware.

¿Qué flujos de trabajo admite MiniMax H3 en ComfyUI?

ComfyUI incluye plantillas H3 para conversión de texto a video (Text-to-Video, T2V), imagen a video (Image-to-Video, I2V) con marcos inicial y/o final opcionales, y referencia a video (Reference-to-Video, R2V). Los tres pueden generar diálogo, efectos de sonido y música nativos en estéreo junto con el video.

¿Cuánta VRAM se necesita para ejecutar MiniMax H3 en ComfyUI?

No existe un mínimo estricto único. Una GPU de 24 GB es un objetivo práctico para el flujo de trabajo podado en int8; pruebas comunitarias reducidas a 480p han funcionado en GPUs de 12 GB con 32 GB de RAM del sistema, descarga parcial (offloading) y almacenamiento rápido.

¿Listo para probarlo tú mismo?

Créditos gratis al registrarte. Planes desde $20/mes.

Prueba Seedance gratis

¿Existe una alternativa más sencilla a la ejecución local de MiniMax H3 en ComfyUI?

Sí. Seedance ofrece generación de audio y video basada en navegador sin necesidad de descargar modelos locales, configurar nodos ni planificar memoria GPU, lo que resulta más simple cuando lo que se busca es un clip finalizado, no un grafo personalizado local.

¿Qué es MiniMax H3 y por qué ejecutarlo en ComfyUI?

MiniMax H3 es un modelo abierto de generación multimodal que entiende texto, imágenes, video y audio dentro de un mismo contexto. Puede producir video hasta en resolución 2K, a 24 fps y aproximadamente 15 segundos de duración, con voz, efectos de sonido y música generados conjuntamente como audio estéreo nativo.

ComfyUI convierte esas capacidades en un grafo de nodos visual. Usted puede elegir la precisión del modelo, la semilla (seed), la resolución, la duración, el programador (scheduler), las referencias, el primer o último fotograma y la ruta de salida; luego guardar el grafo como un flujo de trabajo reutilizable. Las plantillas nativas cubren T2V, I2V y R2V, mientras que los nodos centrales H3 pueden reorganizarse para crear grafos más especializados.

Ejecute H3 localmente cuando el control detallado de parámetros, la reutilización de nodos, la privacidad de las entradas o la automatización por lotes sean más importantes que el tiempo de configuración. Es ideal para creadores que ya conocen ComfyUI y para equipos que desean evitar cuotas por llamada a API. La contrapartida es un uso sustancial de almacenamiento, la necesidad de planificar cuidadosamente la memoria GPU, descargas largas y más resolución de problemas que con un flujo de trabajo basado en navegador.

Requisitos del sistema y descargas de modelos

Actualice ComfyUI a la versión 0.30.0 o posterior, luego abra Workflow → Browse Workflow Templates → Video y seleccione una plantilla MiniMax H3. ComfyUI puede solicitar archivos faltantes, pero colocarlos manualmente facilita el diagnóstico de problemas.

Archivo requerido Colóquelo en Finalidad
minimax_h3_fl2va_pruned_int8_convrot.safetensors ComfyUI/models/diffusion_models/ Generación T2V, I2V y marcos inicial/final
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors ComfyUI/models/text_encoders/ Comprensión multimodal de indicaciones (prompts) y referencias
minimax_h3_video_vae_fp16.safetensors ComfyUI/models/vae/ Codificación y decodificación latente de video
minimax_h3_audio_vae_fp32.safetensors ComfyUI/models/vae/ Codificación y decodificación nativa de audio

R2V usa minimax_h3_ref2va_pruned_int8_convrot.safetensors en diffusion_models/ en lugar del archivo de difusión FL2VA. Mantenga los nombres de archivo completos; tras agregarlos, actualice los modelos o reinicie ComfyUI.

Considere 24 GB de VRAM como un objetivo cómodo para planificar el flujo de trabajo podado en int8, no como un mínimo publicado. Tarjetas gráficas con menos memoria requieren fotogramas más pequeños, clips más cortos, descarga parcial (offloading) agresiva y suficiente RAM del sistema más espacio NVMe para intercambio de modelos. Si el grafo no logra cargarse o pasa la mayor parte del tiempo intercambiando (swapping), reduzca primero la resolución o traslade el flujo de trabajo a hardware en la nube.

Configuración del flujo de trabajo MiniMax H3 Text-to-Video (T2V)

  1. Abra la biblioteca de plantillas y cargue MiniMax H3 T2V.
  2. Confirme que están seleccionados el modelo de difusión, el codificador de texto Qwen3-VL, el VAE de video y el VAE de audio.
  3. En Resolution Selector, elija la relación de aspecto y los megapíxeles; mantenga multiple en 32.
  4. Ingrese una indicación estructurada, establezca la duración y la semilla (seed), luego coloque el grafo en cola.
  5. Revise la imagen, el diálogo, los efectos, la música y el fotograma final antes de aumentar la resolución.

El lienzo de trabajo nativo de H3 usa un borde corto de 768 px y limita un lado a aproximadamente 1344 px. Alrededor de 1,0 megapíxel en relación 16:9 equivale a unos 1344×768. Comience con valores menores para probar indicaciones y luego escale únicamente la configuración ya aprobada. La duración se ajusta automáticamente a la cuadrícula de fotogramas de H3 a 24 fps, por lo que ComfyUI podría ajustar ligeramente el valor solicitado.

Primero describa la escena, luego la acción sincronizada, el movimiento de cámara y el audio, todo dentro del mismo bloque de indicación. Un resumen T2V limpio y conciso es más fiable que una lista de adjetivos cinematográficos no relacionados. Para un punto de partida alojado más rápido, el flujo de trabajo Seedance Text to Video elimina los pasos de configuración local del grafo y descarga de modelos.

MiniMax H3 T2V · salida oficial de la plantilla ComfyUI

Salida oficial de la plantilla ComfyUI para MiniMax H3 T2V. Se trata de una muestra real de flujo de trabajo, alojada nuevamente en Seedance R2 para una reproducción confiable.

Configuración del flujo de trabajo MiniMax H3 Image-to-Video (I2V)

La plantilla I2V usa MiniMaxH3ImageToVideo. Conecte una imagen al nodo first_frame, opcionalmente conecte otra al nodo last_frame, y describa el movimiento entre ambas. Ambas entradas son opcionales a nivel de nodo, por lo que los mismos pesos FL2VA pueden soportar flujos de trabajo guiados por texto, por primer fotograma, por último fotograma o por ambos fotogramas.

I2V funciona mejor para presentaciones de productos, continuidad de personajes, transiciones controladas y animación guiada por estilo. Ajuste la salida al lienzo nativo de H3 con borde corto de 768 px, mantenga las dimensiones divisibles por 32 y evite usar como entrada una imagen demasiado pequeña o fuertemente comprimida. Describa primero lo que debe permanecer inalterado y luego el movimiento de cámara.

Entrada oficial de ratón transparente para juegos utilizada por la plantilla MiniMax H3 I2V

La imagen de entrada real distribuida con la plantilla MiniMax H3 I2V de ComfyUI.

MiniMax H3 I2V · salida oficial de la plantilla ComfyUI

El resultado oficial I2V a partir de esa imagen fuente. Compare la forma del producto, los materiales, la ubicación de la rueda, la trayectoria de la cámara y el sonido —no solo el impacto del primer fotograma.

Si desea la misma idea de entrada-a-movimiento sin mantener pesos locales, pruebe Seedance Image to Video.

Configuración del flujo de trabajo de Referencia-a-Vídeo (R2V) de MiniMax H3

R2V utiliza MiniMaxH3ReferenceToVideo y los pesos de difusión separados ref2va. Acepta imágenes, vídeos y audio mezclados, de modo que una toma objetivo pueda tomar prestada la identidad del personaje, el estilo visual, el movimiento del sujeto, el movimiento de la cámara o la voz de distintas fuentes.

Conecte las referencias en un orden deliberado y asígneles exactamente los siguientes nombres en el prompt: <Picture 1>, <Video 1> y <Audio 1>. Asigne una tarea específica a cada referencia. Por ejemplo: conservar al personaje de <Picture 1>, usar el movimiento de dolly de <Video 1> y coincidir con la voz de <Audio 1>. El flujo de trabajo actual de ComfyUI admite hasta nueve imágenes, tres vídeos y tres clips de audio independientes.

Use ref_image_size=match para pruebas más rápidas o max para preservar el borde corto de una referencia hasta 2048 px cuando la identidad importa más que la velocidad. Demasiadas referencias superpuestas pueden debilitar el seguimiento de instrucciones, así que valide primero un grafo de dos referencias antes de añadir más.

MiniMax H3 R2V · salida oficial de la plantilla ComfyUI

Salida oficial de la plantilla R2V utilizando las referencias de personaje y estilo distribuidas.

Para un flujo de trabajo de referencias alojado, abra Seedance Reference to Video. La guía de vídeo de referencia de MiniMax H3 ofrece un recorrido más detallado sobre la redacción de prompts y la asignación de referencias.

Consejos para redactar prompts y obtener mejores resultados con MiniMax H3

Use tres campos explícitos en los prompts de H3: integrated_multimodal_description, overall_soundscape y non_diegetic_music. Dentro de la descripción de la escena, escriba planos cronometrados, acciones visibles, dirección de cámara y diálogo exacto. Asigne identificadores estables a los hablantes recurrentes, como (S1), y coloque únicamente las palabras habladas dentro de <d>[English] ...</d>.

T2VA — débil: Una escena cinematográfica urbana con un sonido genial.

T2VA — mejor: 0–3 s: plano general de un paso de peatones bajo la lluvia, dolly lento hacia adelante; 3–7 s: mensajero gira hacia la cámara. Pasos y tráfico en estéreo; percusión baja comienza en 4 s.

I2VA/FL2VA — débil: Anime esta imagen de forma dramática.

I2VA/FL2VA — mejor: Conservar la geometría del producto, la rueda, los botones, la carcasa transparente y la iluminación azul-naranja. Una órbita lenta de 30 grados; sin texto ni piezas nuevas. Finalizar alineado con el último fotograma suministrado.

R2V — débil: Usar todas las referencias y crear un vídeo de acción.

R2V — mejor: Conservar la identidad y el vestuario de <Picture 1>; copiar únicamente el movimiento de cámara de <Video 1>; coincidir con el tono vocal de <Audio 1>. No transferir al sujeto ni al fondo del vídeo.

T2VA requiere una descripción completa del mundo. I2VA debe proteger la fuente antes de añadir movimiento. FL2VA y L2VA deben describir la transición hacia el fotograma límite suministrado. R2V debe explicar la relación entre cada referencia y el objetivo. La guía de redacción de prompts de MiniMax H3 amplía estos patrones específicos por modo.

MiniMax H3 en ComfyUI frente a herramientas de vídeo IA basadas en navegador

Factor H3 local en ComfyUI Seedance Comfy Cloud
Configuración Instalar/actualizar ComfyUI y colocar pesos grandes Abrir en un navegador Cargar una plantilla ComfyUI alojada
VRAM local Requerida; los ajustes dependen de la precisión y la salida No requerida No requerida localmente
Control del flujo de trabajo Control total a nivel de nodo y automatización Interfaz simplificada para generación Gráfico ComfyUI sin hardware local
Audio nativo Audio estéreo H3 en la misma generación Flujo de trabajo conjunto audio-vídeo Mismo flujo de trabajo H3 en cómputo en la nube
Ideal para Personalización profunda, entradas locales y grafos reutilizables Ideación y producción rápidas sin configuración Usuarios de ComfyUI sin capacidad GPU local

Elija ComfyUI local cuando el grafo mismo forme parte de su sistema de producción. Elija ComfyUI alojado en la nube cuando desee sus nodos pero no la carga de hardware. Elija Seedance cuando quiera pasar de un prompt o una referencia a un clip utilizable con menos decisiones de infraestructura. Pruebe Seedance en su navegador →

Conclusión

MiniMax H3 es una de las opciones de pesos abiertos más capaces de ComfyUI para generar vídeo y audio nativo simultáneamente. Comience en tres pasos: actualice a ComfyUI 0.30.0+, coloque el modelo de difusión, el codificador de texto y las dos VAE en sus carpetas correspondientes, y luego cargue la plantilla T2V, I2V o R2V adecuada. Mantenga las primeras pruebas pequeñas, asigne una tarea a cada referencia y aumente la resolución solo después de que el prompt funcione; si las descargas locales, la VRAM y el mantenimiento de nodos superan el beneficio del control profundo, un flujo de trabajo Seedance basado en navegador es la ruta más rápida hacia la producción.

¿Listo para probarlo tú mismo?

Pon en práctica los pasos de esta guía con Seedance y convierte prompts o imágenes en videos pulidos en minutos.

Créditos gratis al registrarte. Planes desde $20/mes.