- Blog
- Las mejores configuraciones de MiniMax H3 para calidad, velocidad y audio en 2026
Las mejores configuraciones de MiniMax H3 para calidad, velocidad y audio en 2026

Resumen de IA
¿Cuáles son las mejores configuraciones para la calidad de video de MiniMax H3?
Usa 1344×768 a 16:9, res_multistep, el programador simple, 20 pasos de denoising, guía 1, desplazamiento de video 12 y desplazamiento de audio 3. Esta es la base de calidad fiable y de pesos abiertos.
¿Cuántos pasos debo usar para MiniMax H3 en ComfyUI?
Usa 20 pasos con res_multistep para un renderizado de calidad. Usa solo 4–8 pasos con una Turbo LoRA compatible cuando la velocidad de iteración importe más que el detalle máximo.
¿Qué resolución genera MiniMax H3 localmente frente a su API?
Los pesos locales publicados apuntan a 768p, típicamente 1344×768 a 16:9. El H3 alojado puede entregar salidas de mayor resolución, incluida su canalización Regenerate-2K contextual.
¿Listo para probarlo tú mismo?
Créditos gratis al registrarte. Planes desde $20/mes.
¿Cómo controlo el audio en MiniMax H3?
Nombra cada sonido, voz o instrumento y especifica cuándo ocurre. Conserva la pista estéreo nativa de 32 kHz, usa el desplazamiento de audio 3 como base publicada y simplifica las indicaciones competidoras si se produce desincronización.
Por qué las configuraciones de MiniMax H3 son distintas de otros modelos de video
MiniMax H3 no se comporta como un modelo de difusión convencional con CFG alrededor de 7,5. Está «distilado por guía», por lo que 1 es el valor previsto para la guía; aumentarlo puede endurecer los bordes, desestabilizar el movimiento o empeorar el resultado. Además, H3 genera video y audio estéreo simultáneamente, con cronogramas sigma separados para ambos flujos.
El número de fotogramas sigue una cuadrícula 17n+5 a 24 fps. Un clip local práctico de cinco segundos tiene 124 fotogramas, mientras que los objetivos más largos deben redondearse a un recuento válido en lugar de introducirse como un número arbitrario. Esas tres reglas —guía 1, desplazamientos separados para video y audio, y la cuadrícula de fotogramas— constituyen la base de todas las configuraciones siguientes. Si necesitas primero el grafo completo, usa la guía de configuración de MiniMax H3 para ComfyUI.
Configuraciones de resolución — Explicación de 768p, 1080p y 2K
La resolución debe coincidir con la fase del trabajo. Los pesos abiertos locales alcanzan como máximo la categoría 768p; 1344×768 es el lienzo estándar 16:9 y está cerca de un megapíxel. Un lienzo de 0,5 MP resulta útil para comprobar la composición y la dirección del prompt. La salida alojada elimina la carga de memoria local y añade la ruta de regeneración de mayor resolución.
| Objetivo | Configuración típica | Uso recomendado | Compromiso |
|---|---|---|---|
| Vista previa local | Aproximadamente 0,5 MP | Pruebas de prompt y movimiento | Más rápido, menos detalle |
| Calidad local | 1344×768 a 16:9 | Renderizado local final | Tamaño local más alto publicado |
| 1080p alojado | Preajuste de servicio | Redes sociales, anuncios, revisión por clientes | Más detalle sin VRAM local |
| 2K alojado | Regenerate-2K | Entrega comercial, texto pequeño, recortes | Mayor costo y tiempo de procesamiento |
La decisión es sencilla: itera a 0,5 MP, valida a 768p y luego usa 2K alojado únicamente para la toma seleccionada. El clip oficial generado por H3 que aparece a continuación sirve como útil verificación de calidad: examina la textura de la piel, las manos, los peatones de fondo, los letreros del café y la continuidad del audio, en lugar de juzgar un único fotograma fijo.
Pasos, muestreador y programador — La base funcional
Para los flujos de trabajo actuales en ComfyUI, la base más útil es res_multistep con el programador simple y 20 pasos de denoising. Algunos nodos exponen esto como 21 puntos sigma porque 21 puntos generan 20 avances DiT. No establezcas accidentalmente ambos valores en 20 sin verificar el significado de las etiquetas del nodo.
| Objetivo | Muestreador | Programador | Pasos | Cuándo usarlo |
|---|---|---|---|---|
| Base de calidad | res_multistep |
simple |
20 | Renderizado local final y comparaciones |
| Iteración rápida | Ruta compatible con Turbo | simple |
4–8 | Pruebas de prompt, movimiento y encuadre |
| Reproducción heredada | Euler | Cronograma publicado | 49–50 llamadas | Coincidencia exacta con un flujo de trabajo anterior |
Turbo no es un interruptor universal de «menos pasos»; requiere el adaptador y el grafo correspondientes. Comienza con 4 pasos para el diseño general, pasa a 6–8 cuando los rostros o los movimientos finos necesiten mayor estabilidad y compáralo con una base de 20 pasos antes de la entrega final. La guía de Turbo LoRA para MiniMax H3 muestra la ubicación correcta del cargador, mientras que la guía de entrenamiento de LoRA cubre adaptadores de estilo personalizados.
Escala de guía, desplazamiento y parámetros de audio
Mantén la guía en 1. H3 tiene la guía integrada en los pesos publicados, por lo que valores altos de CFG no mejoran la obediencia al prompt como sí podrían hacerlo en modelos antiguos de imágenes. Para el cronograma de pesos abiertos publicado, usa conjuntamente el desplazamiento de video 12 y el desplazamiento de audio 3. Algunos grafos comunitarios exponen el desplazamiento de audio 4; conserva ese valor únicamente al reproducir exactamente ese flujo de trabajo y vuelve a 3 si las voces, los ritmos o los efectos se desincronizan.
Los prompts de audio funcionan mejor cuando nombran una fuente y un momento: una taza de cerámica toca la mesa a las 00:03, ambiente de tráfico suave durante todo el clip o un paso seco sobre el rellano. Evita solicitar diálogo, música, ruido de multitud, condiciones meteorológicas y múltiples efectos en el mismo clip de cinco segundos. Para una mejor estructura de oraciones y lenguaje temporal, consulta la guía de prompts de MiniMax H3.
Hoja de trucos de configuraciones para ComfyUI
| Parámetro | Calidad primero | Velocidad primero |
|---|---|---|
| Megapíxeles | 1,0 (1344×768) | 0,5 vista previa |
| Pasos | 20 | 4–8 con Turbo LoRA |
| Muestreador | res_multistep |
Muestreador compatible con Turbo |
| Programador | simple |
simple |
| Orientación (guidance) | 1 | 1 |
| Desplazamiento de video | 12 | 12 |
| Desplazamiento de audio | 3 | 3 |
| Fotogramas | Cantidad válida de tipo 17n+5 |
Prueba válida más corta |
| Semilla (seed) | Fija para pruebas A/B | Aleatoria para exploración |
Cambia una fila a la vez. Mantén fija la semilla al comparar resolución, pasos o desplazamientos; de lo contrario, estarás comparando generaciones distintas en lugar de configuraciones. Cuando desees un resultado sin necesidad de descargar checkpoints ni ajustar un grafo, genera con Seedance usando preajustes optimizados →.
Configuraciones para cada modo: T2V, I2V, FLF2V y Ref2VA
| Modo | Ruta del modelo | Qué bloquear | Prioridad de la configuración |
|---|---|---|---|
| T2V | FL2VA | Indicación (prompt) y semilla | Primero la composición, luego el movimiento y el sonido |
| I2V | FL2VA | Primera imagen y relación de aspecto | Ajusta el lienzo latente a la imagen de entrada |
| FLF2V | FL2VA | Primer y último fotogramas | Ajusta ambos extremos; indica solo el recorrido |
| Ref2VA | Ref2VA | Identidad de referencia y ordenación | Asigna únicamente las referencias que requiere la toma |
T2V depende completamente de la estructura de la indicación (prompt), por lo que debes establecer, en este orden: sujeto, acción, cámara, entorno y audio. I2V hereda la composición de la primera imagen; cambiar la relación de aspecto provoca recortes evitables. FLF2V bloquea ambos extremos, así que reduce la indicación al movimiento, sincronización, trayectoria de la cámara y sonido. La guía de primer y último fotograma incluye preparación de imágenes compatible y soluciones para transiciones.
Ref2VA admite un presupuesto de contexto más amplio —hasta nueve imágenes, tres vídeos y tres referencias de audio en flujos de trabajo compatibles—, pero «máximo» no es un objetivo. Siempre que sea posible, usa una o dos imágenes de identidad, un vídeo de movimiento y una referencia de audio limpia. Entradas adicionales compiten por la atención y dificultan la depuración.
Conclusión
Recuerda la línea base de MiniMax H3 como 768p, 20 pasos, res_multistep, simple, orientación (guidance) 1, desplazamientos 12/3; utiliza renderizados Turbo de 0,5 MP y 4–8 pasos únicamente para iteración, y luego traslada la toma elegida a 2K alojado cuando los detalles finales sean relevantes. Ajusta FL2VA o Ref2VA al modo correspondiente, mantén los recuentos de fotogramas en la cuadrícula 17n+5, describe las fuentes de audio con su sincronización y modifica un solo parámetro a la vez.
¿Listo para probarlo tú mismo?
Pon en práctica los pasos de esta guía con Seedance y convierte prompts o imágenes en videos pulidos en minutos.
Créditos gratis al registrarte. Planes desde $20/mes.
Artículos relacionados
Más publicaciones en el mismo idioma que quizá quieras leer después.

MiniMax H3 Primer y Último Fotograma: Cómo controlar ambos extremos de su video generado por IA
Aprenda cómo funciona el video de primer y último fotograma de MiniMax H3, prepare dos imágenes de punto final, redacte indicaciones centradas en el movimiento, use ComfyUI y solucione problemas comunes de FLF2V.
Leer artículo
MiniMax H3: 30 vs. 50 pasos — ¿Qué cambia realmente en calidad y velocidad?
Compara MiniMax H3 con 20, 30 y 50 pasos en cuanto a detalle de imagen, tiempo de generación, calidad de audio, velocidad de Turbo LoRA y la configuración óptima para cada flujo de trabajo.
Leer artículo
Entrenamiento de LoRA para MiniMax H3: Guía completa para ajuste fino de estilos de vídeo personalizados
Preparar un conjunto de datos de vídeo MiniMax H3, elegir entrenamiento T2V, I2V, first-last-frame o Ref2VA, ajustar el rango y la tasa de aprendizaje, y utilizar la LoRA resultante en flujos de trabajo locales o en la nube.
Leer artículo