Flujo de trabajo de dos etapas MiniMax H3: Guía de alta resolución para ComfyUI

E
Emma Chen·10 min de lectura·Sep 2, 2026
Compartir en X
Flujo de trabajo de dos etapas MiniMax H3: Guía de alta resolución para ComfyUI

Resumen de la IA

¿Qué es el flujo de trabajo en dos etapas de MiniMax H3?

Construye movimiento, composición y sonido sobre un lienzo más pequeño en una primera pasada, luego amplía el latent de H3 y ejecuta una segunda pasada con bajo nivel de ruido para reconstruir los detalles de alta resolución.

¿Es más rápido que generar directamente a alta resolución?

Normalmente sí, para iteraciones, porque la primera pasada es menos costosa. La pasada de refinamiento aún se aproxima a la resolución objetivo, por lo que el VRAM máximo y el tiempo total dependen de la escala, la duración y la descarga (offloading).

¿La segunda etapa conserva el audio nativo de MiniMax H3?

Sí, puede hacerlo. Un escalador de latents H3 compatible transporta hacia adelante el latent de audio y le permite bloquearlo o pulirlo ligeramente; un denoising excesivo del audio puede reemplazar o distorsionar la banda sonora.

¿Para quién está diseñado este flujo de trabajo?

Es adecuado para usuarios de ComfyUI que necesitan una salida H3 más nítida, borradores más rápidos o una ruta de bajo consumo de VRAM, y que pueden verificar identidad, movimiento y audio entre ambas pasadas.

Qué hace realmente el flujo de trabajo en dos etapas de MiniMax H3

Un flujo de trabajo en dos etapas de MiniMax H3 separa las decisiones creativas de la reconstrucción de detalles. La Etapa 1 resuelve movimiento, recorrido de cámara, sincronización y audio nativo sobre un lienzo modesto. La Etapa 2 amplía ese latent aprobado y muestrea la trayectoria de menor ruido, reconstruyendo textura sin inventar una nueva interpretación.

Etapa 1: bloquear movimiento, composición y audio

Comience con una toma corta y medible, y fije el prompt, la semilla (seed), la duración, la frecuencia de fotogramas (frame rate) y las referencias. Un lienzo más pequeño hace que sea más económico detectar errores en el movimiento de la cámara o de la mano. Revise todo el clip y rechace movimientos incorrectos antes del refinamiento.

Tres fotogramas terminados del mismo vidriero, preservando identidad, vestimenta, iluminación del taller y continuidad de los objetos

Una primera pasada útil mantiene reconocibles a la misma persona, su delantal, el taller, la herramienta y la forma del vidrio, mientras la toma pasa de una acción general a un detalle cercano.

Etapa 2: escalar y reconstruir detalles

Introduzca la salida denoised del primer muestreador (sampler) en un escalador de latents compatible con H3. Actualice las condiciones (conditioning) a las nuevas dimensiones, añada únicamente la cantidad de ruido necesaria para los detalles y ejecute el segundo muestreador sobre rangos de sigma más bajos. Decodifique tras el refinamiento para preservar la estructura mientras se resuelven las microtexturas.

Muestreo en dos etapas frente a renderizado directo frente a escalado de píxeles tras decodificación

Método Uso recomendado Ventaja principal Riesgo principal
Renderizado directo a resolución objetivo Toma final en hardware capaz Una única ruta de muestreo Intentos fallidos costosos
Flujo de trabajo en dos etapas con latent H3 Movimiento aprobado que requiere más detalle Reconstruye detalles antes de la decodificación Demasiado ruido reintroducido puede alterar la identidad o el audio
Escalado de píxeles tras decodificación Toma estable que solo necesita un archivo de entrega más grande Preservación predecible del movimiento No puede recuperar todos los detalles semánticos ausentes

Para experimentos visuales rápidos sin un grafo local, pruebe la misma estructura de toma en el flujo de trabajo de imagen-a-video de Seedance, y compare movimiento y detalle utilizable, no solo etiquetas de resolución.

Qué necesita antes de importar el flujo de trabajo

Modelos, codificadores y archivos VAE

Comience con un flujo de trabajo MiniMax H3 que ya funcione correctamente. Confirme el checkpoint o modelo cuantizado, el codificador de texto, el VAE y las rutas de los modelos. Guarde ese grafo por separado como su ruta de reversión (rollback path).

Nodos personalizados requeridos

Use un escalador diseñado específicamente para el latent de video y audio empaquetado de H3, no un nodo genérico para imágenes. El primer muestreador debe exponer su salida denoised, el escalador debe transportar el audio y la segunda etapa debe aceptar las condiciones reconstruidas. Resuelva todos los nodos faltantes antes de probar.

Planificación de hardware

Las dos etapas reducen el costo de borradores deficientes; no garantizan menor memoria pico. La pasada de refinamiento sigue procesando el latent ampliado. El VRAM, la RAM del sistema, la precisión, la descarga (offloading), la duración y el lienzo objetivo son factores relevantes. Haga su primera prueba breve y deje espacio en disco para modelos, latents y fotogramas decodificados.

Si un proyecto combina generación alojada y local, el flujo de trabajo de video IA multi-modelo muestra cómo enrutar las tomas según costo, control y riesgo de producción.

Cómo construir el grafo ComfyUI en dos etapas

Comience con una línea base H3 conocida y funcional

Ejecute primero el grafo inmodificado de texto-a-video, imagen-a-video o referencia-a-video. Use un único sujeto, acción, instrucción de cámara y condición sonora. Registre la semilla (seed), las dimensiones, el número de fotogramas, el muestreador (sampler), la precisión y el tiempo de renderizado. Si esta línea base falla, un refinador solo ocultará la causa.

Conecte la Etapa 1 al escalador de latents

Dirija la salida denoised del primer muestreador —no una imagen decodificada— al escalador de latents H3. Use dimensiones compatibles con el grafo y comience con un aumento de escala modesto, para que la preservación del movimiento sea fácil de evaluar.

El mismo perro corriendo mostrado como un borrador más suave en la primera pasada y como un fotograma claramente refinado en la segunda pasada, con pelaje más nítido, costuras del collar y gotas de agua

El lado derecho debe añadir hebras de pelaje, estructura del agua y textura superficial sin cambiar la postura, silueta, expresión ni iluminación del amanecer del perro.

Reconstruya las condiciones para el nuevo lienzo

Escale las condiciones de imagen o referencia a las dimensiones de la segunda etapa. Una discrepancia de tamaño puede deformar rostros, desplazar el encuadre o reinterpretar al sujeto. Mantenga la intensidad de la referencia conservadora, incrementándola únicamente si la identidad sigue derivando.

Ejecute la pasada de refinamiento con sigma bajo

Conecte el latent ampliado a un segundo muestreador con ruido externo desactivado y un rango de sigma de menor ruido. Pruebe la división (split) en lugar de copiar un valor universal. Decodifique con el VAE compatible y guarde el video junto con el audio. La guía de habilidades del agente IA de MiniMax H3 muestra otra forma de organizar referencias y sincronización.

Mejores configuraciones para alta resolución, velocidad y audio nativo

Elija el lienzo base y el factor de escala

El lienzo base debe definir rostros, manos y objetos pequeños, manteniendo bajo el costo de los borradores rechazados. Comience cerca de una resolución H3 comprobada, luego pruebe un paso moderado de escala. Los rostros lejanos pueden requerir un lienzo base más grande, así que no juzgue esta configuración a partir de una toma sencilla.

Divida los pasos y el sigma deliberadamente

El muestreo con mayor ruido determina la disposición y el movimiento; el muestreo con menor ruido resuelve la textura. Si en la etapa dos cambian las extremidades o la dirección de la cámara, inicie el refinamiento más tarde o reduzca el denoise. Si apenas aporta algo, exponga ligeramente más de la trayectoria de menor ruido. Cambie un solo parámetro por prueba.

Bloquee, perfeccione o remezcle el audio

Trate el audio como una rama deliberada. Use audio_denoise en cero cuando la etapa uno ya tenga diálogos, ambientes o música utilizables. Una cantidad ligera puede pulir la textura; un valor elevado puede generar balbuceos, cambios temporales o un tono ambiental distinto.

Fotograma cinematográfico final de un chelista, utilizado para revisar los detalles faciales, el contacto de los dedos, la geometría del arco, la textura de la madera y la sincronización del audio con la interpretación

Un primer plano musical es una prueba exigente: el fotograma refinado debe mantener el arco sobre las cuerdas, los dedos sobre el diapasón, la identidad facial estable y la nota audible alineada con el movimiento.

Reproduzca la muestra completa y observe los impactos de las baquetas, el movimiento de los platillos, la continuidad de las manos y si el sonido permanece vinculado al ritmo visible.

Para tomas en las que varias referencias visuales o auditivas deben cumplir funciones independientes, organícelas primero mediante el espacio de trabajo de referencia a vídeo.

Configuraciones de baja VRAM que importan

Use la descarga de modelos (model offloading), atención eficiente compatible, recuentos conservadores de fotogramas y un solo lote (batch). Decodifique únicamente la versión que inspeccionará. Si la etapa dos sigue agotando la memoria, reduzca primero el tamaño objetivo o la duración antes de apilar más optimizadores.

Cómo importar y validar un archivo JSON de flujo de trabajo MiniMax H3

Importe y resuelva las dependencias

Arrastre el archivo JSON del flujo de trabajo a ComfyUI, lea la lista de nodos faltantes y verifique cada repositorio y ruta de modelo. Tras reiniciar, confirme que las entradas no se hayan restablecido. Guarde el JSON original y versione por separado su grafo modificado.

Ejecute una prueba de línea base controlada

Use una toma de cinco a ocho segundos con una semilla fija. Guarde los resultados de la etapa uno, de las dos etapas y de resolución directa sin modificar el prompt. Para una línea base limpia, el generador de vídeo a partir de texto puede separar los problemas del prompt de los problemas del grafo.

Compare lo que los espectadores realmente pueden ver y oír

Registre el tiempo de renderizado, la VRAM pico, la identidad, la geometría, la trayectoria de la cámara, el parpadeo, la estabilidad del fondo, la claridad del audio y su sincronización. Una imagen fija puede exagerar la nitidez mientras oculta una pobre coherencia temporal, así que vea cada versión a velocidad normal antes de inspeccionar fotogramas difíciles.

Conservar la etapa dos únicamente cuando aporte valor visible. Si afina los detalles pero cambia a la persona, la acción o la banda sonora, reduzca su rango de ruido o use escalado posdecodificación (post-decode upscaling).

Solución de errores: OOM, distorsión del audio, deformación de la identidad y ruido cromático

La etapa dos agota la memoria

Reduzca primero las dimensiones objetivo, luego acorte la duración o incremente la descarga de modelos (offloading). Confirme que ambos modelos no residan de forma involuntaria en la GPU; la etapa dos puede definir la VRAM pico.

Los rostros o personajes cambian

Revise las dimensiones de la condición, la escala de la referencia y el denoise. La deriva de identidad suele indicar que el refinador tiene demasiada libertad o una condición desajustada. Pruebe un lienzo base más cercano antes de añadir la restauración facial.

El diálogo o el ambiente se vuelven ininteligibles

Establezca el denoise de audio en cero y verifique la etapa uno. Si su audio es inestable, asigne más del programa a la etapa uno o simplifique el prompt. La etapa dos no puede reparar de forma fiable una interpretación que la etapa uno nunca estableció.

Los detalles parecen excesivamente procesados o aparece ruido cromático

Retrasar el inicio de la segunda etapa, reducir su denoise y verificar las versiones del VAE y del escalador latente (latent-upscaler). Si el ruido cromático persiste en pruebas controladas, use un escalado de píxeles tras la decodificación en lugar de forzar la ruta latente.

El JSON contiene nodos faltantes o incompatibles

Ajuste las versiones de los nodos y pruebe tras cada cambio. Los errores latentes anidados de vídeo y audio suelen significar que un nodo genérico ha entrado en una ruta específica de H3. Vuelva a la línea base y reconecte una sección a la vez.

Conclusión

Utilice el flujo de trabajo de dos etapas de MiniMax H3 como una tubería de aprobación: resuelva el movimiento, la composición y el audio de forma económica, y luego refine únicamente las tomas que valga la pena conservar. Acepte la etapa dos únicamente cuando aporte detalle sin reescribir la interpretación. Comience con un grafo conocido y válido, preserve el audio, compare un renderizado y cambie una sola variable a la vez. Para validar el encargo, comience con el generador de vídeos de Seedance AI y convierta el mismo prompt o fotograma en un clip de prueba.

¿Listo para probarlo tú mismo?

Pon en práctica los pasos de esta guía con Seedance y convierte prompts o imágenes en videos pulidos en minutos.

Créditos gratis al registrarte. Planes desde $20/mes.