MiniMax H3 ComfyUI: Guia Completo de Configuração para Fluxos de Trabalho T2V, I2V e R2V

E
Emma Chen·9 min de leitura·Aug 17, 2026
MiniMax H3 ComfyUI: Guia Completo de Configuração para Fluxos de Trabalho T2V, I2V e R2V

Visão Geral de IA

É possível executar o MiniMax H3 localmente no ComfyUI?

Sim. O MiniMax H3 possui pesos abertos e suporte nativo no ComfyUI 0.30.0 ou posterior. Carregue um modelo H3, baixe o modelo de difusão necessário, o codificador de texto e os dois VAEs, e execute-o em seu próprio hardware.

Quais fluxos de trabalho o MiniMax H3 suporta no ComfyUI?

O ComfyUI fornece modelos H3 para Conversão de Texto em Vídeo, Conversão de Imagem em Vídeo com quadros inicial/final opcionais e Conversão de Referência em Vídeo. Os três podem gerar diálogo estéreo nativo, efeitos sonoros e música juntamente com o vídeo.

Qual é a quantidade mínima de VRAM necessária para executar o MiniMax H3 no ComfyUI?

Não há um valor mínimo rígido único. Uma GPU de 24 GB é um alvo prático para o fluxo de trabalho podado em int8; testes com resolução reduzida (480p) realizados pela comunidade funcionaram em GPUs de 12 GB com 32 GB de RAM do sistema, descarregamento (offloading) e armazenamento rápido.

Pronto para testar por conta própria?

Créditos grátis ao se cadastrar. Planos a partir de US$20/mês.

Experimente o Seedance grátis

Existe uma alternativa mais simples à execução local do MiniMax H3 no ComfyUI?

Sim. A Seedance oferece geração de áudio-vídeo baseada em navegador, sem necessidade de download local de modelos, configuração de nós ou planejamento de memória da GPU — tornando-a mais simples quando você deseja um clipe finalizado, em vez de um grafo personalizado executado localmente.

O que é o MiniMax H3 e por que executá-lo no ComfyUI?

O MiniMax H3 é um modelo de geração multimodal aberto que entende texto, imagens, vídeo e áudio em um único contexto. Ele pode produzir vídeos com resolução até 2K, taxa de quadros de 24 fps e duração de cerca de 15 segundos, com voz, efeitos sonoros e música gerados simultaneamente como áudio estéreo nativo.

O ComfyUI transforma essas capacidades em um grafo visual de nós. Você pode escolher precisão do modelo, seed, resolução, duração, agendador (scheduler), referências, quadro inicial ou final e caminho de saída — e salvar o grafo como um fluxo de trabalho reutilizável. Modelos nativos cobrem T2V, I2V e R2V, enquanto os nós centrais H3 podem ser recombinados para grafos mais especializados.

Execute o H3 localmente quando controle de parâmetros, nós reutilizáveis, entradas privadas ou automação em lote forem mais importantes do que o tempo de configuração. É adequado para criadores que já conhecem o ComfyUI e equipes que desejam evitar cotas por chamada de API. A contrapartida é o uso substancial de armazenamento, planejamento de memória da GPU, longos tempos de download e maior necessidade de solução de problemas comparado a um fluxo de trabalho baseado em navegador.

Requisitos do Sistema e Downloads de Modelos

Atualize o ComfyUI para 0.30.0 ou posterior, depois abra Workflow → Browse Workflow Templates → Video e selecione um modelo MiniMax H3. O ComfyUI pode solicitar arquivos ausentes, mas sua colocação manual facilita a identificação de problemas.

Arquivo necessário Coloque em Finalidade
minimax_h3_fl2va_pruned_int8_convrot.safetensors ComfyUI/models/diffusion_models/ Geração T2V, I2V e quadros inicial/final
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors ComfyUI/models/text_encoders/ Entendimento multimodal de prompts e referências
minimax_h3_video_vae_fp16.safetensors ComfyUI/models/vae/ Codificação e decodificação latente de vídeo
minimax_h3_audio_vae_fp32.safetensors ComfyUI/models/vae/ Codificação e decodificação nativa de áudio

O R2V usa minimax_h3_ref2va_pruned_int8_convrot.safetensors em diffusion_models/, em vez do arquivo de difusão FL2VA. Mantenha os nomes completos dos arquivos; após adicioná-los, atualize os modelos ou reinicie o ComfyUI.

Considere 24 GB de VRAM como um alvo confortável de planejamento para o caminho podado em int8, não como um mínimo oficial publicado. Placas com menos memória exigem quadros menores, clipes mais curtos, descarregamento (offloading) agressivo e RAM do sistema suficiente, além de espaço NVMe para troca de modelos. Se o grafo não carregar ou passar a maior parte do tempo trocando dados (swapping), reduza primeiro a resolução ou migre o fluxo de trabalho para hardware em nuvem.

Configuração do Fluxo de Trabalho MiniMax H3 Texto para Vídeo (T2V)

  1. Abra a Biblioteca de Modelos e carregue MiniMax H3 T2V.
  2. Confirme se o modelo de difusão, o codificador de texto Qwen3-VL, o VAE de vídeo e o VAE de áudio estão selecionados.
  3. No Resolution Selector, escolha proporção de aspecto e megapixel; mantenha multiple em 32.
  4. Insira um prompt estruturado, defina duração e seed, então enfileire o grafo.
  5. Revise imagem, diálogo, efeitos, música e quadro final antes de aumentar a resolução.

A tela de trabalho nativa do H3 usa borda curta de 768 px e limita um lado a aproximadamente 1344 px. Cerca de 1,0 megapixel em proporção 16:9 corresponde a aproximadamente 1344×768. Comece com resoluções menores para testes de prompt, escalonando apenas a configuração aprovada. A duração é ajustada à grade de blocos de quadros do H3 em 24 fps, portanto o ComfyUI pode ajustar ligeiramente o valor solicitado.

Descreva primeiro a cena, seguida de ação cronometrada, movimento de câmera e áudio, tudo no mesmo bloco de prompt. Um briefing T2V limpo é mais confiável do que uma lista de adjetivos cinematográficos não relacionados. Para um ponto de partida hospedado mais rápido, o fluxo de trabalho Seedance Text to Video elimina os passos de download e configuração local do grafo.

MiniMax H3 T2V · saída oficial do modelo ComfyUI

Saída oficial do modelo ComfyUI para MiniMax H3 T2V. Trata-se de uma amostra real de fluxo de trabalho, republicada no Seedance R2 para reprodução confiável.

Configuração do Fluxo de Trabalho MiniMax H3 Imagem para Vídeo (I2V)

O modelo I2V usa MiniMaxH3ImageToVideo. Conecte uma imagem ao first_frame, opcionalmente conecte outra ao last_frame, e descreva o movimento entre eles. Ambas as entradas são opcionais no nível do nó, portanto os mesmos pesos FL2VA podem suportar fluxos de trabalho guiados por texto, por quadro inicial, por quadro final ou por quadros inicial e final.

O I2V funciona melhor para demonstrações de produtos, continuidade de personagens, transições controladas e animação orientada por estilo. Ajuste a saída à tela nativa do H3 com borda curta de 768 px, mantenha as dimensões divisíveis por 32 e evite fornecer fontes muito pequenas ou fortemente comprimidas. Descreva primeiro o que deve permanecer inalterado, antes de descrever o movimento da câmera.

Entrada oficial de mouse transparente para jogos usada pelo modelo I2V MiniMax H3

A imagem de entrada real distribuída com o modelo I2V MiniMax H3 do ComfyUI.

MiniMax H3 I2V · saída oficial do modelo ComfyUI

Resultado oficial I2V a partir dessa imagem de origem. Compare forma do produto, materiais, posicionamento da roda, trajetória da câmera e som — não apenas o impacto do primeiro quadro.

Se você deseja a mesma ideia de entrada-para-movimento sem manter pesos localmente, experimente Seedance Image to Video.

Configuração do Fluxo de Trabalho de Referência-para-Vídeo (R2V) do MiniMax H3

O R2V usa MiniMaxH3ReferenceToVideo e os pesos de difusão separados ref2va. Ele aceita imagens, vídeos e áudios misturados, de modo que uma tomada-alvo possa emprestar identidade do personagem, estilo visual, movimento do sujeito, movimento da câmera ou voz de diferentes fontes.

Conecte as referências em uma ordem deliberada e nomeie-as exatamente na legenda: <Picture 1>, <Video 1> e <Audio 1>. Atribua uma tarefa específica a cada referência. Por exemplo: preservar o personagem da Picture 1, usar o movimento de dolly do Video 1 e corresponder à voz do Audio 1. O fluxo de trabalho atual do ComfyUI suporta até nove imagens, três vídeos e três clipes de áudio independentes.

Use ref_image_size=match para testes mais rápidos ou max para preservar a borda curta de uma referência até 2048 px quando a identidade for mais importante que a velocidade. Muitas referências sobrepostas podem enfraquecer o cumprimento das instruções; portanto, valide inicialmente um grafo com duas referências antes de adicionar mais.

MiniMax H3 R2V · saída oficial do modelo ComfyUI

Saída oficial do modelo R2V usando as referências de personagem e estilo distribuídas.

Para um fluxo de trabalho de referência hospedado, acesse Seedance Reference to Video. O guia de vídeo por referência do MiniMax H3 oferece um passo a passo mais detalhado sobre redação de legendas e atribuição de referências.

Dicas para Redação de Legendas Visando Melhor Saída do MiniMax H3

Use três campos explícitos nas legendas para o H3: integrated_multimodal_description, overall_soundscape e non_diegetic_music. Dentro da descrição da cena, escreva tomadas cronometradas, ações visíveis, direção da câmera e diálogo exato. Atribua IDs estáveis a falantes recorrentes, como (S1), e coloque apenas as palavras faladas dentro de <d>[English] ...</d>.

T2VA — fraco: Uma cena cinematográfica urbana com um som legal.

T2VA — melhor: 0–3s cruzamento molhado em plano aberto, dolly lento para frente; 3–7s mensageiro vira-se para a câmera. Passos e tráfego em estéreo; percussão baixa começa aos 4s.

I2VA/FL2VA — fraco: Anime esta imagem dramaticamente.

I2VA/FL2VA — melhor: Preserve a geometria do produto, a roda, os botões, a carcaça transparente e a iluminação azul-laranja. Uma órbita lenta de 30 graus; nenhum novo texto ou peça. Termine alinhado ao último quadro fornecido.

R2V — fraco: Use todas as referências e crie um vídeo de ação.

R2V — melhor: Mantenha a identidade e a vestimenta da <Picture 1>; copie apenas o movimento da câmera do <Video 1>; corresponda ao tom vocal do <Audio 1>. Não transfira o sujeito nem o fundo do vídeo.

O T2VA requer uma descrição completa do mundo. O I2VA deve proteger a fonte antes de adicionar movimento. O FL2VA e o L2VA devem descrever a transição para o quadro-limite fornecido. O R2V deve explicar a relação entre cada referência e o alvo. O guia de legendas do MiniMax H3 expande esses padrões específicos por modo.

MiniMax H3 no ComfyUI Local vs. Ferramentas de Vídeo por IA Baseadas em Navegador

Fator H3 Local no ComfyUI Seedance Comfy Cloud
Configuração Instalar/atualizar o ComfyUI e colocar grandes pesos Abrir em um navegador Carregar um modelo ComfyUI hospedado
VRAM Local Necessária; configurações dependem da precisão e da saída Não necessária Não necessária localmente
Controle do Fluxo de Trabalho Controle total no nível de nós e automação Interface simplificada de geração Grafo ComfyUI sem hardware local
Áudio Nativo Áudio estéreo H3 na mesma geração Fluxo de trabalho conjunto áudio-vídeo Mesmo fluxo de trabalho H3 em computação em nuvem
Ideal para Personalização profunda, entradas locais, grafos reutilizáveis Ideação e produção rápidas sem configuração Usuários do ComfyUI sem capacidade local de GPU

Escolha o ComfyUI local quando o próprio grafo fizer parte do seu sistema de produção. Escolha o ComfyUI hospedado em nuvem quando quiser seus nós, mas sem a carga de hardware. Escolha o Seedance quando quiser ir diretamente da legenda ou referência para um clipe utilizável com menos decisões de infraestrutura. Experimente o Seedance no seu navegador →

Conclusão

O MiniMax H3 é uma das opções de pesos abertos mais capazes do ComfyUI para gerar vídeo e áudio nativo simultaneamente. Comece em três etapas: atualize para o ComfyUI 0.30.0+, coloque o modelo de difusão, o codificador de texto e os dois VAEs nas pastas corretas, depois carregue o modelo T2V, I2V ou R2V correspondente. Mantenha os primeiros testes pequenos, atribua uma tarefa a cada referência e aumente a resolução somente após a legenda funcionar; se os downloads locais, a VRAM e a manutenção de nós superarem os benefícios do controle profundo, um fluxo de trabalho Seedance baseado em navegador será o caminho mais rápido para a produção.

Pronto para testar por conta própria?

Coloque os passos desta guia em prática com Seedance e transforme prompts ou imagens em vídeos polidos em minutos.

Créditos grátis ao se cadastrar. Planos a partir de US$20/mês.