MiniMax H3 Primeira e Última Imagem: Como controlar ambas as extremidades do seu vídeo IA

E
Emma Chen·8 min de leitura·Aug 18, 2026
MiniMax H3 Primeira e Última Imagem: Como controlar ambas as extremidades do seu vídeo IA

Visão geral da IA

O que é a funcionalidade de primeira e última imagem do MiniMax H3?

O FLF2V (First-and-Last-Frame to Video) do MiniMax H3 recebe uma imagem inicial e uma imagem final, gerando então o movimento visual e o áudio estéreo sincronizado entre elas. Você define ambos os pontos finais, enquanto o prompt orienta a trajetória.

Qual é a diferença entre primeira e última imagem e imagem para vídeo?

A conversão de imagem para vídeo fixa apenas o quadro inicial. A funcionalidade de primeira e última imagem fixa ambas as extremidades, obrigando assim o modelo a atingir uma composição final específica, em vez de inventá-la.

Quais formatos e resoluções de imagem o FLF2V do MiniMax H3 aceita?

As ferramentas hospedadas do H3 aceitam imagens web comuns, incluindo JPEG e PNG, e a proporção de saída segue a da primeira imagem. Ajuste ambas as imagens às mesmas dimensões e proporção antes do envio.

Pronto para testar por conta própria?

Créditos grátis ao se cadastrar. Planos a partir de US$20/mês.

Experimente o Seedance grátis

Posso usar a funcionalidade de primeira e última imagem do MiniMax H3 sem uma GPU local?

Sim. Os endpoints do H3 hospedados na nuvem realizam a geração remotamente, enquanto usuários locais podem executar o fluxo de trabalho de pesos abertos no ComfyUI, desde que possuam hardware adequado.

O que o MiniMax H3 Primeira e Última Imagem realmente faz

O vídeo de primeira e última imagem do MiniMax H3 (ou FLF2V) trata duas imagens estáticas como âncoras visuais rígidas. A primeira imagem fixa o quadro zero. A última imagem fixa o destino. Entre elas, o H3 planeja o movimento, o comportamento da câmera, mudanças de iluminação, transformações de objetos e áudio estéreo nativo. Uma flor fechada pode se abrir em plena floração, uma rua ao meio-dia pode evoluir para a hora azul ou uma caixa de produto lacrada pode terminar totalmente aberta.

A conversão convencional de imagem para vídeo possui apenas a primeira âncora, portanto o quadro final pode desviar em pose, enquadramento, cor ou geometria do produto. O FLF2V reduz essa incerteza. Ele não simplesmente aplica um crossfade: o modelo sintetiza uma rota plausível entre duas composições. Isso torna o controle dos pontos finais muito mais robusto, embora a parte intermediária ainda dependa da compatibilidade entre as imagens e o prompt.

Imagens oficiais de início e fim da API MiniMax ilustrando o conceito FLF2V de duas âncoras

Um par real de primeira e última imagem retirado da documentação oficial da API MiniMax. Quadros compatíveis no formato 16:9 fornecem ao modelo um caminho limpo do retrato inicial ao retrato final.

Casos de uso — Quando duas imagens âncora superam uma única

Duas âncoras são mais úteis quando o quadro final é tão importante quanto o inicial:

Caso de uso Primeira imagem Última imagem O que o H3 planeja
Revelação de produto Embalagem fechada Produto totalmente exibido Ação de abertura, transferência, destaques e som
Transição temporal Rua ao nascer do sol Céu noturno Mudanças de iluminação, tráfego, céu e ambiente
Ação de personagem Pose em pé Aterrissagem controlada Trajetória corporal, movimento de tecidos, impacto e acompanhamento pela câmera
Conexão de storyboard Quadro A aprovado Quadro B aprovado Um quadro conectivo entre dois painéis
Anúncio antes/depois Cômodo original Reforma concluída Transformação de materiais e layout

O exemplo oficial do H3 abaixo é um clipe gerado finalizado, não uma ilustração conceitual. Observe como a máscara fixa de binóculos e os acentos vermelhos repetidos fornecem fortes pistas de continuidade ao modelo, enquanto a câmera explora os momentos planejados.

MiniMax H3 Primeira & Última Imagem · exemplo oficial gerado de filme institucional

Como usar o FLF2V — Passo a passo via API MiniMax e Seedance

  1. Prepare duas imagens compatíveis. Recorte ambas para a mesma proporção e dimensões. Mantenha a escala do sujeito, o eixo da câmera e a geometria principal suficientemente próximas para garantir uma transição crível.
  2. Descreva o movimento, não a aparência. As imagens já definem o sujeito e sua aparência. Escreva a ação, o ritmo, o movimento da câmera e as pistas sonoras que devem conectá-las.
  3. Envie os dois pontos finais. Uma requisição ao H3 hospedado usa a imagem inicial mais um campo para a imagem final; em um fluxo de trabalho baseado em navegador, siga o guia Seedance de primeira e última imagem e envie as duas imagens na ordem correta.
  4. Gere um teste curto. Comece com a duração mais curta útil. Revise a parte intermediária quanto a desvios de identidade, dissoluções indesejadas, aparecimento repentino de objetos (popping) e áudio que contradiga a ação.
  5. Altere apenas uma variável por vez. Se a trajetória estiver incorreta, simplifique primeiro o prompt de movimento antes de substituir imagens de ponto final que funcionam bem.

Se você precisar apenas animar uma única imagem de produto ou personagem aprovada e não se importar com o quadro final exato, o espaço de trabalho mais simples Seedance Imagem para Vídeo costuma ser mais rápido.

Executando Primeira e Última Imagem no ComfyUI

Atualize o ComfyUI antes de construir o grafo; este fluxo de trabalho pressupõe a versão 0.30.0 ou superior. Carregue o modelo de difusão H3 FL2VA, o codificador de texto Qwen3-VL e o VAE compatíveis, depois adicione o nó nativo de condicionamento MiniMaxH3ImageToVideo. Conecte as duas entradas de imagens decodificadas aos parâmetros first_frame e last_frame, defina a largura e altura-alvo e escolha uma duração válida na grade de quadros 17k+5 do H3. Um teste comum de cinco segundos corresponde a 124 quadros a 24 fps.

Mantenha ambas as imagens de entrada com a mesma proporção do latent. O amostrador distilado por guidance do H3 utiliza guidance 1; aumentar o CFG convencional pode reduzir a estabilidade em vez de melhorá-la. A configuração completa do MiniMax H3 no ComfyUI cobre os arquivos base e a ordem do grafo.

Para iterações mais rápidas, adicione um adaptador Turbo compatível e teste a inferência em quatro passos antes de aumentar o número de etapas. O guia MiniMax H3 Turbo LoRA mostra o posicionamento do carregador e as intensidades recomendadas. O Turbo ajuda a pré-visualizar a transição, mas uma etapa final de alta qualidade ainda pode se beneficiar do fluxo de trabalho base.

Sugestões de Escrita que Funcionam com Dois Quadros Fixos

As imagens finais já respondem à pergunta o que é visível. Uma sugestão útil para FLF2V explica como a tomada se desloca entre elas: ação do sujeito, velocidade, trajetória da câmera, mudança ambiental e som. Evite repetir todos os detalhes visuais, pois isso pode conflitar com os quadros fornecidos. Para uma sintaxe mais ampla e vocabulário cinematográfico, consulte o Guia de sugestões MiniMax H3.

Revelação de produto: A câmera executa uma órbita lenta de 30 graus enquanto a tampa se ergue em um único movimento contínuo. Um destaque suave percorre a superfície metálica; sem cortes nem dissoluções. Movimento preciso das dobradiças, ambiência de estúdio silenciosa, clique sutil do fecho.

Transição dia–noite: Mantenha a posição da câmera fixa. O tempo avança suavemente da quente tarde avançada até a hora azul; as luzes práticas acendem uma a uma, o tráfego prossegue naturalmente e a ambiência da cidade distante torna-se ligeiramente mais alta.

Aterrissagem de personagem: O personagem cai através do quadro, gira uma vez e aterra na pose final agachada. A câmera inclina-se para baixo e desacelera suavemente até parar no momento do impacto. O casaco e os cabelos seguem o movimento com inércia realista; um único som limpo de aterrissagem.

Essas sugestões especificam direção e ritmo sem redescrever a vestimenta fixa, o local ou o produto. Use linguagem explícita de continuidade — uma tomada contínua, sem corte, preservar o logotipo — apenas quando uma falha comprometeria gravemente a transição.

Limitações, Problemas Conhecidos e Soluções Práticas

Problema Por que ocorre Solução prática
Recorte ou salto nas extremidades As imagens usam proporções ou escalas de sujeito diferentes Igualar o tamanho da tela; alinhar horizonte, linha dos olhos e centro do sujeito antes do envio
Morfismo no meio Os dois quadros implicam uma mudança geométrica impossível Reduzir a distância visual ou adicionar uma etapa intermediária de geração
Chegada fraca ao final Muitas ações competem por uma duração curta Manter uma única ação principal e reservar o último segundo para acomodação final
Dissolução cruzada indesejada A sugestão descreve uma transformação, mas não um movimento físico Nomear o mecanismo: abre, gira, desdobra, caminha ou a câmera faz pan
Áudio fora do ritmo O áudio é gerado junto com o movimento, não sincronizado quadro a quadro Solicitar uma única pista sonora simples e substituir o áudio crítico na pós-produção
Incompatibilidade de duração O H3 local segue a grade de quadros 17k+5 Usar contagens válidas, como 124, 209 ou 294 quadros a 24 fps

A principal causa de falha é exigir que duas imagens descrevam mundos distintos. Uma fotografia de produto centralizada em estúdio não pode se transformar naturalmente numa cena de ação externa aberta em um único clipe curto, sem introduzir geometria inventada. O FLF2V funciona melhor quando os quadros finais diferem quanto ao estado, à postura, à iluminação ou à posição da câmera — mas ainda compartilham um sujeito e um espaço coerentes.

Conclusão

O modo first-and-last-frame do MiniMax H3 é a escolha certa quando um vídeo deve começar e terminar em imagens aprovadas: iguale os dois quadros, descreva apenas o movimento entre eles, teste uma transição curta e simplifique qualquer elemento que morfe ou salte. Use geração em nuvem quando priorizar velocidade, ou ComfyUI quando precisar de controle local; quando estiver pronto para transformar dois quadros-chave num clipe final para campanha, sem configurar uma GPU local, crie seu próximo vídeo com Seedance →.

Pronto para testar por conta própria?

Coloque os passos desta guia em prática com Seedance e transforme prompts ou imagens em vídeos polidos em minutos.

Créditos grátis ao se cadastrar. Planos a partir de US$20/mês.