MiniMax H3 Ref2V contre FL2VA : quel flux de travail choisir ?

E
Emma Chen·12 min de lecture·Sep 5, 2026
Partager sur X
MiniMax H3 Ref2V contre FL2VA : quel flux de travail choisir ?

MiniMax H3 Ref2V contre FL2VA ne relève pas d’un simple concours de qualité. Il s’agit de deux familles de tâches conçues pour des types de contrôle différents. Le nom officiel de Ref2V est Ref2VA : elle utilise des images, des vidéos et des fichiers audio comme références réutilisables pour le sujet, le style, le mouvement ou la voix. FL2VA utilise zéro, une ou deux images clés pour définir où commence un plan, où il se termine, ou les deux.

La question pratique n’est donc pas « quelle version du modèle est meilleure ? », mais plutôt « qu’est-ce qui doit rester fixe dans ce plan ? ». Si l’identité ou le produit doivent être préservés malgré un nouvel angle de caméra et un nouvel environnement, choisissez Ref2VA. Si la composition au début ou à la fin doit être exacte, choisissez FL2VA.

Aperçu IA

Quelle est la principale différence entre MiniMax H3 Ref2V et FL2VA ?

Ref2VA intègre des références réutilisables de sujet, de style, de vidéo ou d’audio dans un plan nouvellement composé. FL2VA anime depuis une image initiale vers une image finale, ou entre ces deux points extrêmes.

Dois-je utiliser Ref2VA ou FL2VA pour assurer la cohérence d’un personnage ?

Utilisez Ref2VA lorsque le personnage doit apparaître dans de nouveaux lieux ou sous de nouveaux angles de caméra. Utilisez FL2VA lorsque vous disposez déjà de la composition exacte que vous souhaitez animer.

Les deux modes MiniMax H3 peuvent-ils générer de l’audio ?

Oui. Les deux familles de tâches génèrent des vidéos avec un son stéréo natif intégré. Ref2VA constitue le choix privilégié lorsqu’un extrait audio ou une timbre vocal fait partie du lot de références.

Quel mode est le plus simple pour un premier test ?

FL2VA est généralement plus simple, car il peut démarrer à partir d’une seule image et d’une seule instruction. Ref2VA devient pertinent lorsque l’information contenue dans une seule image ne suffit plus à décrire l’identité, le mouvement ou l’audio requis.

Ref2VA contre FL2VA : la règle décisionnelle concise

Les utilisateurs comparant ces modes recherchent souvent une règle décisionnelle applicable avant même de charger des centaines de gigaoctets de poids ou de construire deux graphes ComfyUI. Appliquez cette règle : FL2VA préserve un point final ; Ref2VA préserve un rôle de référence.

Besoin de production Point de départ recommandé Pourquoi
Animer une image fixe finalisée FL2VA L’image source correspond exactement à la composition initiale ou finale
Relier une ouverture et une fermeture prédéfinies FL2VA Deux images clés définissent les deux points extrêmes
Placer le même acteur dans un lieu différent Ref2VA L’identité peut être dissociée de la nouvelle composition du plan
Réutiliser un produit dans plusieurs mises en scène publicitaires Ref2VA Plusieurs vues peuvent décrire la géométrie et les matériaux
Réutiliser une voix, une ambiance ou des indices de mouvement Ref2VA Les fichiers audio et vidéo peuvent être attribués comme références
Générer à partir d’un texte sans entrée visuelle Famille FL2VA La même famille de versions du modèle couvre également la génération texte-vers-vidéo

La sortie H3 est 24 fps, avec un son stéréo natif 32 kHz, et le flux de travail de base produit normalement une résolution de 768p avant toute étape séparée de régénération haute résolution. Ces spécifications de sortie partagées n’annulent pas la différence de conditionnement. Le choix de la version du modèle détermine toujours le type d’éléments probants fournis au modèle.

Pour une introduction plus large à l’attribution multimodale de références, consultez le guide vidéo de référence MiniMax H3.

Quand Ref2VA est l’outil le plus adapté

Vous recherchez un sujet, pas une composition figée

Ref2VA s’apparente davantage à un casting. Fournissez-lui des éléments probants permettant d’identifier ce qui doit rester reconnaissable, puis décrivez un nouveau plan. Le modèle ouvert accepte jusqu’à neuf images, jusqu’à trois vidéos de référence et jusqu’à trois extraits audio, pour un maximum de douze fichiers au total, répartis entre tous les types de références. La durée des vidéos et des fichiers audio de référence est limitée : chaque support doit donc avoir une fonction bien définie.

N’importe pas neuf portraits quasi identiques uniquement parce que neuf emplacements sont disponibles. Un jeu de références efficace pour un personnage pourrait inclure une vue nette du visage, une vue en trois-quarts du corps et un détail vestimentaire. Un jeu de références pour un produit pourrait comporter des vues frontale, latérale et rapprochée de sa géométrie. Une référence de mouvement devrait illustrer un rythme ou un mouvement de caméra que les images fixes ne sauraient transmettre.

Le même interprète aux cheveux argentés reste reconnaissable dans une ruelle pluvieuse, un plan large dans le désert et un gros plan lumineux en studio

Observez la forme du visage, les cheveux argentés, la veste cobalt et la boucle d’oreille à travers des changements importants d’objectif, d’éclairage et d’environnement — le genre d’éléments probants qu’un test Ref2VA devrait évaluer.

Attribuez une tâche unique à chaque référence

Une instruction Ref2VA efficace nomme chaque entrée et précise son rôle. Par exemple : « L’image 1 définit l’acteur », « La vidéo 1 fournit le mouvement de travelling » et « L’audio 1 fournit le timbre vocal » est plus clair que demander au modèle de tout copier de toutes les sources. Lorsque deux références entrent en conflit, précisez laquelle prime pour le visage, la tenue, le mouvement, l’environnement et le son.

MiniMax H3 Ref2VA official reference-to-video output

Résultat officiel issu d’un modèle Ref2VA : évaluez si l’identité et le style subsistent malgré le mouvement nouvellement généré, plutôt que de juger uniquement sur une image nette.

Pour une structure prête à l’emploi, le guide de formulation des instructions MiniMax H3 explique comment séparer la définition du sujet de la description du plan cible et de l’ambiance sonore.

Quand FL2VA est l’outil le plus adapté

Une image contient déjà la réponse

Choisissez FL2VA lorsque la source n’est pas simplement une inspiration : elle constitue le plan lui-même. Avec une seule image, vous pouvez la traiter comme la première image et animer vers l’avant, ou comme la dernière image et faire arriver le mouvement à ce point précis. Avec deux images, le modèle dispose d’extrémités visuelles explicites. Cela rend FL2VA utile pour les révélations contrôlées, les raccords par correspondance, les boucles, les arrivées sur cartes-titres, les transformations de produits et les actions devant aboutir à une pose prédéfinie.

L’erreur courante consiste à exiger un angle de caméra que l’image source ne permet pas de soutenir. Un gros plan en portrait ne contient ni le dos de la veste, ni la pièce entière, ni la démarche de l’acteur. FL2VA peut inventer des informations manquantes, mais chaque invention accroît le risque de rupture de continuité. Si la tâche exige un plan véritablement nouveau plutôt qu’un mouvement à l’intérieur de la composition fournie, passez à Ref2VA.

Une ouverture cohérente, un kickflip aérien et un atterrissage final à côté du même train, le tout dans une même gare

Une évaluation utile de FL2VA vérifie si le mouvement intermédiaire est crédible, tout en s’assurant que la pose finale, la géométrie du train, la direction et la tenue correspondent bien au point d’arrivée prévu.

Concevoir des extrémités compatibles

Les images initiale et finale doivent concorder sur l’identité du sujet, la tenue vestimentaire, la géométrie de la scène, le format d’image et un mouvement plausible. De grands changements non expliqués obligent le modèle à résoudre plusieurs problèmes simultanément. Si la première image montre un acteur debout dans une gare et la dernière un objectif différent, une tenue différente, une saison différente et un lieu différent, la transition risque de consacrer toute sa durée limitée à la morphose plutôt qu’à l’exécution de l’action.

MiniMax H3 official first-and-last-frame output

Résultat officiel FL2VA : observez la précision des points d’arrivée, le trajet entre les images et la façon dont l’audio natif suit l’action visuelle.

Le guide MiniMax H3 « premier et dernier plan » aborde plus en détail la conception des points d’arrivée.

Mettre en place le bon flux de travail ComfyUI

Charger uniquement la famille de tâches nécessaire

MiniMax H3 distribue des familles de points de contrôle distinctes pour FL2VA et Ref2VA. Il ne s’agit pas de deux étiquettes de menu attachées à un seul graphe identique. FL2VA accepte un texte accompagné de conditions facultatives (première et dernière image). Ref2VA accepte des références ordonnées d’images, de vidéos et d’audios, ainsi qu’une instruction décrivant comment ces références se rapportent à la cible.

Commencez par valider le graphe le plus simple. Pour FL2VA, utilisez une première image propre, une courte instruction de mouvement, une graine fixe et une durée courte. N’ajoutez une dernière image qu’après avoir obtenu un résultat naturel avec une seule image. Pour Ref2VA, commencez avec une image d’identité et une description du plan cible. N’ajoutez une deuxième vue, une vidéo de mouvement ou un extrait vocal que lorsque l’échec indique clairement quelle preuve manque.

Le guide de configuration MiniMax H3 ComfyUI fournit le chemin complet d’installation locale. Conservez les familles de modèles dans des répertoires clairement nommés afin qu’un chargeur mis en cache ne fasse pas passer un test Ref2VA pour un test FL2VA.

Décrire la cible, pas l’inventaire des références

Une fois les références définies, décrivez la vidéo finale dans l’ordre temporel. Précisez la caméra, l’action, l’environnement, le dialogue, l’ambiance et la musique. Ne consacrez pas l’intégralité de l’instruction à répéter ce qui est déjà visible sur les images de référence. Ref2VA nécessite une spécification d’un nouveau plan ; FL2VA nécessite un trajet de mouvement plausible entre les éléments déjà visibles.

Tester les deux modes sur le même cahier des charges

Évaluer l’échec qui compte

Exécutez le même cahier des charges créatif dans les deux modes uniquement lorsque celui-ci peut être formulé de façon équitable pour les deux. Verrouillez la durée, le format d’image, l’intention de l’instruction, la politique de graine et les critères d’évaluation. Puis évaluez l’identité, la géométrie des objets, la précision des points d’arrivée, la qualité du mouvement, le contrôle de la caméra, la pertinence audio et le taux d’images utilisables.

Ref2VA doit l’emporter lorsque le même sujet doit survivre à une nouvelle composition. FL2VA doit l’emporter lorsque la composition initiale ou finale doit correspondre à l’entrée fournie. Une image plus nette ne compense pas la présence du mauvais acteur ; un acteur cohérent ne compense pas l’absence de la carte finale requise.

La même radio rouge usée conserve sa grille, son cadran, sa poignée et ses proportions dans les configurations atelier, appartement et publicité côtière

Pour les produits, examinez la géométrie de la grille, le positionnement du cadran, la forme de la poignée, l’usure de la peinture et le nombre de boutons dans tous les environnements — pas seulement la couleur globale.

Compter les sorties acceptées, pas les tentatives de rendu

Le flux de travail le moins coûteux est celui qui produit un plan approuvé avec le moins de nouvelles tentatives possible. Notez la raison de chaque échec. Si FL2VA modifie systématiquement l’identité lors d’un grand mouvement de caméra, le cahier des charges nécessite probablement Ref2VA. Si Ref2VA rate systématiquement une composition d’ouverture ou de fermeture exacte, fournissez ce point d’arrivée via FL2VA plutôt que d’ajouter davantage d’adjectifs descriptifs.

Pour les séquences plus longues, intégrez le résultat approuvé dans le flux de travail multi-points-clés MiniMax H3, plutôt que d’espérer qu’une seule génération résolve une scène entière.

Utiliser Seedance Agent lorsque vous ne souhaitez pas gérer deux pipelines locaux

La voie locale basée sur des modèles open-source offre un contrôle approfondi, mais le coût opérationnel augmente lorsque chaque plan exige une sélection de points de contrôle, un nettoyage des références, une restructuration des instructions, un suivi des versions et des nouvelles tentatives manuelles. C’est précisément là que Seedance Agent s’intègre naturellement.

title=Ref2V vs FL2VA: When to Use Which Mode
description=Compare Ref2V and FL2VA workflows for video generation—when to choose first-and-last-frame (FL2VA) over reference-to-video (Ref2V), and how to avoid common pitfalls.
tags=ref2v,fl2va,first-and-last-frame,reference-to-video,video-generation,minimaxDonnez à l’Agent l’objectif créatif et le dossier de référence, puis examinez le plan de prises proposé avant d’engager des ressources pour les générations finales. Cela permet de conserver les rôles de référence associés au brief, de choisir un parcours de génération adapté, d’organiser les alternatives et de relancer uniquement la prise ayant échoué, plutôt que de vous obliger à reconstruire entièrement le graphe local. L’avantage utile ne réside pas dans la dissimulation du modèle, mais dans la centralisation conjointe des décisions, des preuves, des sorties et de l’historique des validations.

Utilisez Ref2VA ou FL2VA en local lorsque vous avez besoin d’un contrôle reproductible au niveau des nœuds et que vous disposez du matériel nécessaire pour maintenir les deux familles de tâches. Utilisez l’Agent hébergé lorsque vous souhaitez passer des références aux prises approuvées sans traiter la gestion des points de sauvegarde comme une seconde chaîne de production. Vous pouvez lancer le flux de travail avec Seedance Agent et comparer les sorties réelles avant de vous engager dans une séquence plus longue.

Conclusion

La comparaison entre MiniMax H3 Ref2V et FL2VA devient simple dès lors que vous définissez l’invariant. Choisissez Ref2VA lorsque l’acteur, le produit, le style, l’indice de mouvement ou la voix doivent être préservés dans une prise nouvellement composée. Choisissez FL2VA lorsqu’une image fournie correspond exactement à la composition à animer, ou lorsque deux images définissent précisément le début et la fin requis. Construisez le graphe le plus petit possible, attribuez un rôle unique à chaque référence, testez le taux d’acceptation des sorties, et changez de mode dès qu’un échec révèle que vous protégez la mauvaise chose. Si vous souhaitez bénéficier du même processus de planification des références, du même choix de modèle, de la même revue et de la même logique de relance partielle — sans devoir maintenir deux pipelines locaux — essayez le flux de travail Seedance Agent.

Prêt à essayer par vous-même ?

Mettez en pratique les étapes de ce guide dans Seedance et transformez vos prompts ou images en vidéos abouties en quelques minutes.

Crédits offerts à l'inscription. Forfaits à partir de $20/mois.