Guía de configuración local de MiniMax H3: ComfyUI, modelos, VRAM y primera renderización

E
Emma Chen·12 min de lectura·Sep 8, 2026
Compartir en X
Guía de configuración local de MiniMax H3: ComfyUI, modelos, VRAM y primera renderización

AI Overview

¿Puede ejecutarse MiniMax H3 localmente?

Sí. MiniMax publicó los pesos H3 y paquetes compatibles con ComfyUI, pero una instalación funcional requiere el modelo de difusión correcto, el codificador de texto, el VAE de vídeo, el VAE de audio, el flujo de trabajo adecuado y suficiente memoria del sistema para la descarga (offloading).

¿Cuánta VRAM necesita MiniMax H3?

No existe un requisito único, ya que la precisión, la cuantización, la resolución, la duración y la descarga afectan el uso de memoria. Una GPU de 24 GB es un objetivo práctico para flujos de trabajo podados en INT8; las tarjetas más pequeñas requieren una cuantización más agresiva y paciencia.

¿Qué modelo de MiniMax H3 debo descargar?

Elija FL2VA para generación guiada por texto, primer fotograma, último fotograma o imagen. Elija Ref2VA cuando el flujo de trabajo utilice múltiples imágenes de referencia, vídeos o audio. Nunca descargue ciegamente el repositorio completo.

¿Es mejor H3 local que Seedance Agent?

H3 local ofrece el máximo control sobre gráficos y archivos. Seedance Agent es preferible si desea resultados de H3 sin tener que gestionar manualmente controladores, pesos, soluciones alternativas para VRAM, registros de tomas, aprobaciones ni ejecuciones parciales.

Determine si su equipo está listo

Verifique conjuntamente la memoria de la GPU, la RAM del sistema y el almacenamiento

Una guía de configuración local de MiniMax H3 debe comenzar por evaluar la capacidad, no por comandos de instalación. El repositorio oficial de MiniMax ocupa casi 498 GB porque incluye múltiples pipelines y componentes. Normalmente solo necesita un punto de control (checkpoint) de difusión, un codificador de texto coincidente, el VAE de vídeo, el VAE de audio y un flujo de trabajo. Incluso una pila reducida puede ocupar decenas de gigabytes antes de contar cachés, archivos temporales y vídeos de salida.

Para comenzar de forma sencilla con ComfyUI, 24 GB de VRAM constituyen un objetivo práctico para un modelo de difusión podado en INT8 junto con un codificador de texto fuertemente reducido y descarga activada. Doce a dieciséis gigabytes pueden funcionar mediante rutas comunitarias GGUF u otras cuantizadas, aunque la configuración se vuelve más sensible y la generación más lenta. Las afirmaciones sobre 8 GB normalmente dependen de una descarga intensiva a CPU/RAM y de un entorno de ejecución específico, por lo que deben considerarse como «capacidad de inicio» más que como «experiencia cómoda». Mantenga disponible una cantidad generosa de RAM del sistema y espacio en SSD rápido; la VRAM no es el único límite.

El generador alojado de MiniMax H3 es la prueba de control más rápida. Ejecute allí primero la misma idea breve. Si el resultado local falla, podrá distinguir entre limitaciones del prompt o del modelo y problemas de instalación.

Un herrero golpea una escultura en forma de creciente brillante en un taller iluminado

Concepto de resultado final creado para esta guía. Rostro, vestimenta, geometría del creciente, contacto con la herramienta, chispas y distribución del taller conforman una exigente primera verificación local de calidad.

Trate el Silicon de Apple como una ruta independiente

El índice oficial de integración ahora apunta a una ruta experimental nativa de Metal para H3 en Silicon de Apple, pero no es el mismo camino operativo que la configuración estándar CUDA y ComfyUI. No copie comandos de wheels para NVIDIA en una Mac y espere que funcionen. Verifique el chip compatible, la memoria, los tipos de flujo de trabajo y las limitaciones actuales del proyecto elegido, y luego realice una pequeña prueba. Para producción fiable en una Mac, una ruta alojada puede ser más rápida que depurar un puerto local aún incipiente.

Elija la pila y el flujo de trabajo correctos

Comience con ComfyUI a menos que necesite control a nivel de biblioteca

ComfyUI es la ruta local más accesible porque las plantillas actuales integran el cargador de modelos, el codificador de texto, el VAE, el muestreador, la decodificación de audio y el ensamblaje final del vídeo. Actualice ComfyUI antes de importar una plantilla H3; versiones estables antiguas podrían no reconocer los tipos de nodos requeridos. Comience con una plantilla base y sin nodos personalizados opcionales. Añada aceleración, caché, interpolación o escalado únicamente después de que funcione correctamente una renderización de referencia limpia.

Una ruta directa mediante Diffusers o Python personalizado resulta útil para desarrollo de servicios e investigación, pero expone más decisiones sobre dependencias y pipelines. El fragmento simple mostrado en una página de alojamiento de modelos puede no representar el flujo de trabajo completo de audio y vídeo. Si su objetivo es generar un solo clip local, comience desde un flujo de trabajo mantenido en lugar de reconstruir manualmente cada componente a partir de nombres de archivo.

Asocie FL2VA o Ref2VA con la tarea correspondiente

FL2VA es la familia utilizada para video a partir de texto, video a partir de imagen y control mediante primer/último fotograma. Ref2VA es una familia distinta de puntos de control para imágenes de referencia, vídeos y audio. Cargar un flujo de trabajo Ref2VA con pesos FL2VA no es una sustitución inocua: el grafo espera una ruta de condicionamiento diferente. La guía Ref2V frente a FL2VA explica detalladamente esta decisión.

Para una primera prueba, elija video a partir de texto con FL2VA o I2V con una sola imagen. Tienen menos componentes móviles. Pase a Ref2VA únicamente cuando la prueba básica confirme que el entorno de ejecución, el VAE y la cadena de salida están funcionando correctamente.

Descargue y coloque los archivos necesarios

Cree un manifiesto antes de descargar

Anote exactamente el nombre del archivo de flujo de trabajo y todos los nombres de archivo de modelos a los que hace referencia. Un manifiesto práctico tiene cuatro filas: modelo de difusión, codificador de texto, VAE de vídeo y VAE de audio. Registre la precisión, el tamaño del archivo, el repositorio de origen, el directorio de destino y la suma de comprobación (checksum), si se proporciona. Esto evita dos errores costosos: descargar todas las variantes disponibles y emparejar archivos que no fueron diseñados para el mismo grafo.

Para un paquete actual de ComfyUI, el patrón de directorios es:```text ComfyUI/models/diffusion_models/<H3 diffusion checkpoint> ComfyUI/models/text_encoders/<matching Qwen3-VL text encoder> ComfyUI/models/vae/<MiniMax H3 video VAE> ComfyUI/models/vae/<MiniMax H3 audio VAE>


La canalización local de pesos abiertos genera video a 768p; la regeneración alojada en 2K es un servicio independiente. No descargue un archivo etiquetado como «2K» esperando que la gráfica local habitual adquiera ese modo de salida.

### Verifique los nombres de archivo antes de iniciar

Tras cada descarga, compare el tamaño en bytes y la suma de comprobación (checksum), y confirme que el nombre del archivo en el selector de flujo de trabajo coincida exactamente con el archivo presente en el disco. Las descargas parciales de modelos pueden seguir apareciendo en una carpeta y fallar más tarde con errores confusos de tensores o deserialización. Mantenga claramente identificados los pesos de difusión de FL2VA y Ref2VA. Si prueba varias cuantizaciones, modifique un componente a la vez y guarde cada gráfica funcional bajo un nombre nuevo con versión.

![El mismo herrero da un golpe preciso y cercano con el martillo sobre la media luna](https://r2.seedance.tv/blog/minimax-h3-local-setup-guide/blacksmith-hammer-detail-output-v1.png)

*Un fotograma final detallado revela si una configuración local preserva la identidad, el contacto manual, la geometría de la herramienta y la escultura ante cambios de distancia de la cámara.*

## Importe el flujo de trabajo y realice una renderización de referencia

### Cargue primero, luego resuelva los nodos rojos

Abra la plantilla oficial en una instalación actualizada de ComfyUI. Si los nodos aparecen en rojo o son desconocidos, deténgase e identifique si pertenecen al núcleo actual de ComfyUI o a un paquete personalizado documentado. No instale todos los nodos sugeridos por un gestor. Reinicie tras modificar los paquetes requeridos, vuelva a abrir la plantilla y seleccione los cuatro archivos de manifiesto en sus cargadores correspondientes.

Establezca una duración corta, una resolución conservadora en orientación apaisada, los ajustes estándar de muestreo de la plantilla y un único prompt sencillo. Evite LoRAs, paquetes de referencia, escaladores, interpolación de fotogramas y prompts largos con múltiples tomas. Sus primeros criterios de aceptación son mecánicos: el prompt se encola correctamente, el modelo se carga una sola vez, el muestreo avanza, el video y el audio se decodifican, el MP4 final se reproduce y una segunda ejecución no vuelve a descargar ni recompilar inesperadamente.

### Use un único prompt que revele fallos comunes

Pruebe un sujeto realizando una acción física en un lugar bien iluminado con un evento audible: «Un herrero con camisa índigo y delantal marrón golpea una vez una escultura en forma de media luna; chispas saltan hacia la izquierda y luego la baja hacia un tanque de temple; luz diurna brillante en el taller, rostro y manos estables, impacto claro del martillo y vapor». Esto revela identidad, geometría del objeto, contacto, movimiento, iluminación y sonido sin convertirse en una historia completa.

```official-video
src=https://r2.seedance.tv/blog/minimax-h3-first-and-last-frame/official-flf-output-v1.mp4
poster=https://r2.seedance.tv/blog/minimax-h3-first-and-last-frame/official-flf-poster-v1.png
label=MiniMax H3 first-and-last-frame output sample

Una salida terminada de H3 para verificar si la gráfica local genera movimiento real, una transición coherente y un archivo reproducible completo, en lugar de fotogramas aislados.

Corrija los fallos locales más comunes

Diagnostique según la etapa en la que falló

Un error de memoria insuficiente durante la codificación de texto apunta al codificador de texto o a su estrategia de descarga (offload); uno durante el muestreo apunta al modelo de difusión, al tamaño latente, a la duración, a la implementación de atención o al comportamiento de descarga; uno durante la decodificación apunta al VAE de video/audio y a la memoria disponible. Registre el último nodo completado, en lugar de tratar cada bloqueo como «memoria VRAM insuficiente». Reduzca primero la duración y la resolución, cierre aplicaciones GPU competidoras y pruebe una cuantización conocida como compatible.

Si un VAE no se carga, verifique que los archivos de video y audio estén en models/vae, que estén completos y que sean seleccionados por el cargador correcto. Si el video final no contiene sonido, confirme que el VAE de audio haya decodificado la porción de audio del latente conjunto y que el nodo final de video haya multiplexado ambos flujos. La guía de velocidad de VAE y TensorRT para H3 ayuda a distinguir cuellos de botella en la decodificación de la velocidad de muestreo.

El herrero sumerge la misma media luna incandescente mientras sube vapor

El vapor, el contacto con el agua, las tenazas, el rostro y la forma de la media luna constituyen un punto de verificación más exigente de movimiento y decodificación tras superar con éxito el disparo simple con el martillo.

Añada optimizaciones una a una

Una vez que la versión de referencia funcione, duplique el flujo de trabajo antes de añadir una LoRA Turbo, SageAttention, almacenamiento en caché de bloques, otra cuantización o una ruta personalizada de VAE. Modifique una sola variable y ejecute nuevamente con la misma semilla y el mismo prompt. Registre el uso máximo de VRAM, el tiempo real (wall time), el tamaño de la salida, los artefactos visibles y la calidad del audio. Una aceleración de cuatro pasos puede alterar movimientos rápidos o sonido; la velocidad solo cuenta si el clip sigue cumpliendo los criterios de revisión.

Convierta una gráfica funcional en un flujo de trabajo productivo

Versione conjuntamente la gráfica, el entorno y la salida

Guarde el JSON del flujo de trabajo funcional junto con un manifiesto que incluya el commit de ComfyUI, los commits de nodos personalizados, Python, PyTorch, CUDA, GPU, los hashes de los modelos, la semilla, las dimensiones, la duración y los ajustes del muestreador. Exporte por separado un flujo de trabajo en formato API si planea enviarlo mediante /prompt; el JSON del editor y el JSON de la API no son intercambiables. Guarde las previsualizaciones, los MP4 finales y los registros bajo el mismo identificador de trabajo.

Para historias más largas, use bloques cortos y lleve adelante los puntos finales aceptados. El flujo de trabajo con múltiples fotogramas clave cubre anclajes visuales intermedios, mientras que el flujo de trabajo multitoma reanudable muestra cómo los puntos de control evitan reiniciar toda la tarea tras un fallo cerca del final.

MiniMax H3 reference-to-video output sample

Una salida de referencia H3 finalizada y diferenciada, para evaluar identidad, influencia de la referencia, comportamiento de la cámara, audio nativo y el archivo multiplexado final tras estabilizarse la ruta básica FL2VA.

Elija H3 local o Seedance Agent

Mantenga el control local cuando genere un valor real

H3 local tiene sentido cuando los archivos del modelo deben permanecer en su equipo, necesita nodos personalizados o cuantizaciones experimentales, puede mantener un entorno GPU y el tiempo de iteración es aceptable. Le brinda acceso directo al JSON del flujo de trabajo, a las semillas, a los estados intermedios y a los puntos finales de automatización. Ese control resulta valioso para investigación y tuberías especializadas, pero implica una obligación continua de mantenimiento.

Seedance Agent se adapta a equipos que desean usar H3 sin convertir la compatibilidad con controladores, el almacenamiento, la descarga, las versiones de nodos y la recuperación de renderizado en un segundo proyecto. Puede traducir un breve resumen en un plan de tomas revisable, mantener los roles de referencia y los criterios de aceptación vinculados a cada toma, presentar salidas terminadas y volver a ejecutar únicamente la sección débil tras su aprobación.

El herrero pulimenta la media luna de plata terminada en el mismo taller

El fotograma final verifica si identidad, vestimenta, distribución del taller y geometría de la media luna sobreviven a toda la secuencia local —desde el impacto hasta el objeto terminado.

Conclusión

Una configuración local MiniMax H3 fiable comienza eligiendo la familia de tareas adecuada, no descargando todo lo etiquetado como H3. Confirme la compatibilidad de hardware y almacenamiento, actualice ComfyUI, empareje un punto de control de difusión con su codificador de texto correspondiente y ambos VAE, coloque los archivos en las carpetas esperadas y ejecute un renderizado básico corto antes de añadir aceleración o referencias complejas. Versione cada combinación funcional para que un nuevo nodo o una nueva cuantización no borre una configuración previamente validada. Si el control local es menos importante que la planificación, la revisión, la continuidad y la producción recuperable, inicie el proyecto con Seedance Agent y use MiniMax H3 sin tener que mantener toda la pila usted mismo.

¿Listo para probarlo tú mismo?

Pon en práctica los pasos de esta guía con Seedance y convierte prompts o imágenes en videos pulidos en minutos.

Créditos gratis al registrarte. Planes desde $20/mes.