- Blog
- MiniMax H3 Première et dernière image : comment contrôler les deux extrémités de votre vidéo IA
MiniMax H3 Première et dernière image : comment contrôler les deux extrémités de votre vidéo IA

Aperçu de l’IA
Qu’est-ce que la fonction « première et dernière image » de MiniMax H3 ?
MiniMax H3 FLF2V prend une image initiale et une image finale, puis génère le mouvement visuel et l’audio stéréo synchronisé entre elles. Vous définissez les deux extrémités, tandis que l’invite guide le parcours.
En quoi la méthode « première et dernière image » diffère-t-elle de l’image-à-vidéo ?
L’image-à-vidéo verrouille uniquement la trame initiale. La méthode « première et dernière image » verrouille les deux extrémités, ce qui oblige le modèle à aboutir à une composition finale précise au lieu d’en inventer une.
Quels formats d’image et résolutions MiniMax H3 FLF2V accepte-t-il ?
Les outils H3 hébergés acceptent les formats d’images web courants, notamment JPEG et PNG ; le rapport d’aspect de la sortie suit celui de la première image. Assurez-vous que les deux images ont les mêmes dimensions et le même rapport d’aspect avant de les téléverser.
Prêt à essayer par vous-même ?
Crédits offerts à l'inscription. Forfaits à partir de $20/mois.
Puis-je utiliser MiniMax H3 « première et dernière image » sans GPU local ?
Oui. Les points de terminaison H3 hébergés dans le cloud gèrent la génération à distance, tandis que les utilisateurs locaux peuvent exécuter le flux de travail open-weight dans ComfyUI s’ils disposent d’un matériel adapté.
Ce que fait réellement MiniMax H3 « Première et dernière image »
La vidéo « première et dernière image » (FLF2V) de MiniMax H3 traite deux images fixes comme des ancres visuelles rigoureuses. La première image fixe la trame zéro. La dernière image fixe la destination. Entre les deux, H3 planifie le mouvement, le comportement de la caméra, les changements d’éclairage, les transformations d’objets et l’audio stéréo natif. Une fleur fermée peut s’ouvrir en épanouissement, une rue en plein jour peut évoluer vers l’heure bleue, ou une boîte de produit scellée peut finir entièrement ouverte.
L’image-à-vidéo classique ne possède qu’une seule ancre (la trame initiale), si bien que la fin peut dériver en termes de pose, de cadrage, de couleur ou de géométrie du produit. FLF2V réduit cette incertitude. Il ne s’agit pas simplement d’un fondu enchaîné : le modèle synthétise un trajet plausible entre deux compositions. Cela renforce considérablement le contrôle des extrémités, bien que la partie centrale dépende encore de la compatibilité entre les images et l’invite.

Une paire réelle « première et dernière image » tirée de la documentation officielle de l’API MiniMax. Des images aux proportions identiques (16:9) offrent au modèle un chemin clair depuis le portrait initial jusqu’au portrait final.
Cas d’usage — Pourquoi deux images ancrées valent mieux qu’une seule
Deux ancres sont particulièrement utiles lorsque la dernière prise est aussi importante que la première :
| Cas d’usage | Première image | Dernière image | Ce que H3 planifie |
|---|---|---|---|
| Révélation de produit | Emballage fermé | Produit entièrement exposé | Action d’ouverture, transfert, mises en valeur, son |
| Transition temporelle | Rue à l’aube | Skyline nocturne | Changements de lumière, de circulation, de ciel et d’ambiance |
| Action de personnage | Pose debout | Atterrissage maîtrisé | Trajectoire du corps, mouvement des vêtements, impact, suivi caméra |
| Liaison de storyboard | Plan A approuvé | Plan B approuvé | Prise de liaison entre deux panneaux |
| Publicité « avant/après » | Pièce d’origine | Rénovation terminée | Transformation des matériaux et de l’agencement |
L’exemple officiel H3 ci-dessous montre un clip généré achevé, et non une illustration conceptuelle. Remarquez comment le masque binoculaire fixe et les accents rouges répétés fournissent au modèle des indices solides de continuité, tandis que la caméra balaie les moments planifiés.
Comment utiliser FLF2V — Guide étape par étape via l’API MiniMax et Seedance
- Préparez deux images compatibles. Recadrez les deux au même rapport d’aspect et aux mêmes dimensions. Conservez une échelle similaire du sujet, un axe caméra proche et une géométrie majeure suffisamment cohérente pour assurer une transition crédible.
- Décrivez le mouvement, pas l’apparence. Les images définissent déjà le sujet et son aspect. Rédigez l’action, le déroulé temporel, le mouvement de caméra et les indices audio qui doivent les relier.
- Soumettez les deux extrémités. Une requête H3 hébergée utilise l’image initiale ainsi qu’un champ « image finale » ; dans un flux de travail navigateur, suivez le guide Seedance « première et dernière image » et téléversez les deux images dans l’ordre.
- Générez un test court. Commencez par la durée la plus courte utile. Examinez la partie centrale à la recherche de dérive d’identité, de fondu indésirable, de « popping » d’objets ou d’audio contradictoire avec l’action.
- Modifiez une seule variable à la fois. Si le trajet est erroné, simplifiez d’abord l’invite de mouvement avant de remplacer des images d’extrémité satisfaisantes.
Si vous devez simplement animer une seule image de produit ou de personnage approuvée, sans vous soucier précisément de la fin, l’espace de travail plus simple Seedance Image to Video est généralement plus rapide.
Exécuter « Première et dernière image » dans ComfyUI
Mettez à jour ComfyUI avant de construire le graphe ; ce flux de travail suppose la version 0.30.0 ou ultérieure. Chargez le modèle de diffusion H3 FL2VA, l’encodeur de texte Qwen3-VL et le VAE compatibles, puis ajoutez le nœud de conditionnement natif MiniMaxH3ImageToVideo. Connectez les deux entrées d’images décodées aux ports first_frame et last_frame, définissez la largeur et la hauteur cibles, et choisissez une longueur valide sur la grille de trames 17k+5 d’H3. Un test courant de cinq secondes correspond à 124 trames à 24 ips.
Conservez les deux images d’entrée au même rapport d’aspect que le latent. L’échantillonneur distillé par guidance d’H3 utilise une guidance de 1 ; augmenter la CFG classique peut réduire la stabilité plutôt que l’améliorer. Le guide complet de configuration MiniMax H3 pour ComfyUI couvre les fichiers de base et l’ordre du graphe.
Pour itérer plus rapidement, ajoutez un adaptateur Turbo compatible et testez une inférence en quatre étapes avant d’augmenter le nombre d’étapes. Le guide MiniMax H3 Turbo LoRA indique l’emplacement du chargeur et les intensités recommandées. Turbo facilite la prévisualisation de la transition, mais un passage final de haute qualité peut toutefois bénéficier du flux de travail de base.
Consignes d’écriture fonctionnelles avec deux images fixes
Les images finales indiquent déjà ce qui est visible. Une consigne FLF2V utile explique comment le plan évolue entre elles : action du sujet, vitesse, trajectoire de la caméra, changement environnemental et son. Évitez de répéter tous les détails visuels, car cela peut entrer en conflit avec les images fournies. Pour une syntaxe plus large et un vocabulaire spécifique à la caméra, consultez le guide de consignes MiniMax H3.
Découverte d’un produit : La caméra effectue une orbite lente de 30 degrés pendant que le couvercle s’ouvre d’un seul mouvement continu. Un reflet doux parcourt la surface métallique ; aucun raccord ni fondu n’est utilisé. Mouvement précis des charnières, ambiance studio feutrée, clic subtil du loquet.
Transition jour–nuit : Maintenir la position de la caméra. Le temps s’écoule progressivement de la chaude fin d’après-midi à l’heure bleue ; les sources lumineuses pratiques s’allument une par une, le trafic continue naturellement et l’ambiance urbaine lointaine gagne légèrement en intensité.
Atterrissage d’un personnage : Le personnage tombe dans le cadre, effectue une rotation complète, puis atterrit dans la posture accroupie finale. La caméra bascule vers le bas puis ralentit progressivement jusqu’à l’arrêt complet au moment de l’impact. Manteau et cheveux suivent le mouvement avec une inertie réaliste ; un seul son net d’atterrissage.
Ces consignes précisent direction et rythme sans redécrire les éléments fixes tels que la tenue vestimentaire, le lieu ou le produit. Utilisez un langage explicite de continuité — plan continu, aucun raccord, préserver le logo — uniquement là où un échec compromettrait la transition.
Limites, problèmes connus et solutions pratiques
| Problème | Pourquoi cela se produit | Solution pratique |
|---|---|---|
| Recadrage ou saut aux extrémités | Les images utilisent des rapports ou des échelles de sujet différents | Ajuster la taille de la zone de travail (canvas) ; aligner l’horizon, la ligne des yeux et le centre du sujet avant le téléchargement |
| Déformation au milieu | Les deux images impliquent un changement géométrique impossible | Réduire la distance visuelle ou ajouter une étape intermédiaire de génération |
| Arrivée faible à la fin | Trop d’actions concurrentes sur une courte durée | Conserver une seule action principale et réserver la dernière seconde pour le « settling » (stabilisation) |
| Fondu croisé non souhaité | La consigne décrit une transformation mais pas un mouvement physique | Nommer explicitement le mécanisme : s’ouvre, tourne, se déploie, marche ou panoramique de la caméra |
| Désynchronisation audio | L’audio est généré conjointement au mouvement, sans verrouillage par image | Demander un seul effet sonore simple, puis remplacer l’audio critique en post-production |
| Mismatch de durée | Le modèle local H3 suit la grille de trames 17k+5 |
Utiliser des nombres valides de trames, tels que 124, 209 ou 294 trames à 24 fps |
La cause principale d’échec reste la demande faite à deux images de décrire des univers distincts. Une photo de produit centrée en studio ne peut pas naturellement devenir, en un court clip, une scène d’action extérieure large sans introduire une géométrie inventée. Le mode « première et dernière image » de FLF2V donne ses meilleurs résultats lorsque les extrémités diffèrent en état, en pose, en éclairage ou en position de caméra — tout en partageant un sujet et un espace cohérents.
Conclusion
Le mode « première et dernière image » de MiniMax H3 constitue le choix approprié lorsqu’une vidéo doit commencer et se terminer sur des visuels approuvés : faites correspondre les deux images, décrivez uniquement le mouvement entre elles, testez une courte transition et simplifiez tout ce qui provoque une déformation ou un saut. Utilisez la génération dans le cloud si vous privilégiez la rapidité, ou ComfyUI si vous exigez un contrôle local ; lorsque vous êtes prêt à transformer deux images clés en une séquence publicitaire finale sans configurer de GPU local, créez votre prochaine vidéo avec Seedance →.
Prêt à essayer par vous-même ?
Mettez en pratique les étapes de ce guide dans Seedance et transformez vos prompts ou images en vidéos abouties en quelques minutes.
Crédits offerts à l'inscription. Forfaits à partir de $20/mois.
Articles associés
D'autres articles dans la même langue à lire ensuite.

MiniMax H3 : 30 contre 50 étapes — Ce qui change réellement en termes de qualité et de vitesse
Comparez MiniMax H3 à 20, 30 et 50 étapes pour le détail des images, le temps de génération, la qualité audio, la vitesse Turbo LoRA, ainsi que le réglage optimal pour chaque flux de travail.
Lire l'article
Meilleurs paramètres MiniMax H3 pour la qualité, la vitesse et l’audio en 2026
Utilisez les meilleurs paramètres MiniMax H3 pour la résolution, le nombre d’étapes, l’échantillonneur, le planificateur, le guidance, l’audio et tous les modes de génération H3 dans ComfyUI ou sur le cloud.
Lire l'article
Entraînement LoRA pour MiniMax H3 : Guide complet du fine-tuning pour des styles vidéo personnalisés
Préparez un jeu de données vidéo MiniMax H3, choisissez l’entraînement T2V, I2V, first-last-frame ou Ref2VA, ajustez le rang et le taux d’apprentissage, puis utilisez le LoRA résultant dans des flux de travail cloud ou locaux.
Lire l'article