- Blog
- Référence Vidu vers vidéo : formule, exemples et corrections de cohérence
Référence Vidu vers vidéo : formule, exemples et corrections de cohérence

AI Overview
Que doit contenir une consigne Vidu « référence vers vidéo » ?
Attribuez à chaque image un rôle précis, décrivez une action visible unique, nommez le comportement de la caméra, définissez le décor et l’éclairage, puis indiquez ce qui doit rester inchangé. Formulez chaque instruction de façon vérifiable dans la séquence finale.
Combien d’images de référence Vidu peut-il utiliser ?
Les pages de création actuelles de Vidu indiquent un support allant de une à sept images de référence. N’utilisez que des images apportant une identité, un objet, une tenue, un environnement ou une contrainte stylistique distincte.
Comment garantir la cohérence d’un personnage dans Vidu ?
Utilisez des vues claires et compatibles, et répétez brièvement une « verrouillage d’identité » couvrant le visage, les cheveux, la tenue, la silhouette et les accessoires caractéristiques. Réduisez les sujets concurrents, les pronoms ambigus et les changements de caméra superflus.
Seedance Agent prend-il en charge un flux de travail multi-référence ?
Oui. Seedance Agent peut transformer une brève description accompagnée de références en un plan de prise de vue révisable, maintenir les contraintes attachées à chaque prise, et relancer uniquement les sorties ne satisfaisant pas les critères de continuité ou de mouvement.
Ce que doivent contrôler les consignes Vidu Reference to Video
Traitez chaque image comme un élément de production
Les personnes recherchant des consignes Vidu « référence vers vidéo » ont besoin d’une consigne expliquant au modèle pourquoi chaque image téléchargée est fournie. Le flux de travail actuel de Vidu accepte des références pour des personnages, des objets et des décors, tandis que ses pages de création mentionnent un support allant de une à sept images. Sept références faibles ne sont pas automatiquement meilleures que trois références claires.
Avant d’écrire la consigne, attribuez à chaque image une étiquette privée : Personnage A, Personnage B, Produit, Lieu, Tenue ou Style. Déterminez ensuite si l’image constitue un ancrage strict de continuité ou une simple influence visuelle. Un portrait frontal peut verrouiller l’identité faciale ; une vue en pied protège la silhouette et les vêtements ; une image de lieu établit l’architecture et l’éclairage. Si deux images se contredisent, la consigne ne pourra pas résoudre de façon fiable ce conflit.
L’espace de travail « référence vers vidéo » est l’endroit le plus direct pour organiser ce type de tâche. Si vous ne disposez que d’une seule image source, l’espace de travail « image vers vidéo » offre une base plus simple avant d’ajouter davantage de contraintes.

Concept final guidé par référence, créé pour ce guide. La femme, le manteau jaune moutarde, le lévrier blanc avec une oreille noire, la valise cobalt, le quai mouillé et le train argenté constituent les ancrages de continuité.
Définissez le succès avant la génération
Rédigez une liste de cinq critères d’acceptation à côté de la consigne : même femme, mêmes marques du chien, même manteau, même géométrie de la valise et même gare côtière. Le mouvement et le cadrage peuvent varier ; ces ancrages, non. Cela transforme une impression vague du type « ça ne semble pas juste » en une révision précise telle que « restaurez l’oreille droite noire du chien et conservez la sangle beige de la valise ».
La formule en cinq parties pour les consignes
1. Rôles des références et ancrages de continuité
Commencez par une liste concise des rôles : « L’image 1 correspond au visage de la femme et à sa coupe au carré ; l’image 2 représente son manteau imperméable jaune moutarde ; l’image 3 montre le lévrier blanc avec une oreille noire ; l’image 4 illustre la valise rigide cobalt dotée d’une sangle beige. » Évitez les pronoms ambigus lorsque deux sujets potentiels sont visibles.
2. Une action avec un début et une fin lisibles
Décrivez une action unique pouvant s’intégrer à la durée demandée : « Le train s’arrête, la femme s’agenouille pour attacher la laisse, puis se relève lorsque les portes s’ouvrent. » Cette formulation est plus maîtrisable que de demander, dans une courte séquence, l’arrivée, l’embarquement, une conversation, une rotation de caméra et le départ. Précisez une pose finale pour que la dernière seconde ne se dissolve pas dans un mouvement aléatoire.
3. Caméra, décor, éclairage et ligne de verrouillage
Nommez la taille du plan et un seul mouvement de caméra : « plan moyen-large à hauteur des yeux, lent rapprochement. » Terminez par une ligne de verrouillage : « Conservez l’identité faciale, les marques du chien, la couleur du manteau, la forme de la valise, l’architecture de la gare et la direction à l’écran ; aucune jambe supplémentaire, aucun accessoire remplacé, aucun texte ni logo. »

Une deuxième image finale modifie l’action et la distance de la caméra tout en conservant les ancrages sélectionnés : personnage, animal, tenue, bagage et lieu.
Consignes Vidu Reference to Video prêtes à copier-coller
Consigne pour personnage, animal et lieu
« Utilisez la référence 1 pour le visage de la femme, sa coupe au carré noire courte et ses proportions ; la référence 2 pour son manteau imperméable jaune moutarde, ses bottes noires et son sac à dos ; la référence 3 pour le lévrier blanc mince avec une oreille droite noire ; la référence 4 pour la valise rigide cobalt dotée d’une seule sangle verticale beige ; et la référence 5 pour le quai mouillé d’une gare côtière. Un train argenté glisse de droite à gauche. La femme s’agenouille, attache la laisse brune au collier du chien, regarde vers la porte qui s’ouvre, puis se relève. Plan moyen-large à hauteur des yeux avec un lent rapprochement, lumière douce matinale après la pluie, mouvement réaliste. Conservez tous les ancrages nommés, les deux mains de la femme, l’anatomie du chien et la direction à l’écran. Aucune personne supplémentaire au premier plan, aucun texte, aucun logo. »
Si le résultat pose problème, supprimez une image non essentielle de tenue ou d’arrière-plan avant d’ajouter davantage de texte descriptif.
Consigne pour la géométrie d’un produit
« Utilisez la référence 1 comme produit exact : bouteille isolée mate corail-orange, bouchon à anneau noir, collier étroit argenté, bande ondulée multi-ligne crème pâle, proportions inchangées. Utilisez la référence 2 pour l’environnement de cascade de basalte humide. La main d’un randonneur s’approche et soulève la bouteille tandis que l’eau éclabousse la base. Cadrage bas et rapproché, léger mouvement vers l’avant, produit net avec une cascade doucement floutée, brume fraîche de l’aube et lumière chaude sur le pourtour. Préservez à chaque image la forme du bouchon, la largeur du collier, le positionnement des ondes, la finition de surface et la couleur. Aucun texte sur l’étiquette, aucun logo, aucune bosse, aucune bouteille en double, aucun doigt déformé ni aucune dérive chromatique. »

Un plan produit final permet d’inspecter facilement la géométrie, la couleur, la construction du bouchon, le contact avec la main et le mouvement environnemental.
Prompt d’interaction à deux personnages
« La référence 1 est le personnage A, un chef portant un tablier anthracite. La référence 2 est le personnage B, un cycliste vêtu d’une veste cobalt. La référence 3 est une petite cuisine ouverte aux carreaux verts. Le personnage A fait glisser un bol en céramique sur le comptoir ; le personnage B le reçoit à deux mains et sourit. Plan moyen verrouillé à deux personnages, un léger rack focus fluide du bol vers le personnage B, lumière chaude provenant d’une fenêtre. Conservez à tout moment les traits du visage, les coiffures, les tenues, les hauteurs relatives, le motif du bol, l’agencement du comptoir et les positions gauche-droite. Aucun échange de visage, aucun doigt supplémentaire, aucune modification vestimentaire, aucun texte dialogué ni aucun découpage caméra. »
Pour davantage d’exemples illustrant comment un système de références se distingue d’un générateur à tir unique, consultez le guide des alternatives Vidu. Ce guide aide à séparer les questions d’accès et de choix produit du problème de conception de prompt traité ici.
Choisir et étiqueter les images de référence
Utiliser des vues complémentaires, pas des quasi-doublons
Un jeu de références utile pour un personnage comprend une vue frontale, une vue trois-quarts et une vue complète de la tenue. Pour un produit, on peut utiliser un angle héroïque, une vue de côté et une vue montrant le contact avec la main. Pour un lieu, choisissez une image large accompagnée d’un détail devant rester visible dans les plans rapprochés.
Recadrez les éléments parasites en arrière-plan, mais conservez les détails nécessaires à l’échelle. Évitez les filtres beauté intenses, les distorsions extrêmes, les mains occultées, les contours de produit illisibles et les éléments d’interface superflus. Nommez vos références sauvegardées de façon stable, par exemple MAYA_YELLOW_COAT ou CORAL_BOTTLE_V1.
Adapter le prompt au cadrage
Si la source est un portrait serré, ne demandez pas une rotation rapide en plan général mettant en scène une tenue non visible. Commencez près du cadrage de référence, validez l’identité et la géométrie, puis éloignez progressivement la caméra ou ajoutez du mouvement une variable à la fois. Cela révèle quelle modification a provoqué une dérive.
Une sortie éditoriale Seedance existante, non un benchmark officiel Vidu. Examinez le visage du sujet, ses vêtements, le contact des pieds avec le sol, la circulation en arrière-plan et la pose finale, tandis que la caméra et la foule sont en mouvement.
Corriger les dérives d’identité, de produit et de décor
Corriger l’identité avant d’ajouter le style
Si le visage change à distance, rapprochez la caméra, réduisez la rotation de la tête, ajoutez une référence trois-quarts plus marquée et raccourcissez l’action. Répétez uniquement les repères faciaux les plus significatifs. Si les vêtements changent, nommez une fois, dans la liste des personnages, puis à nouveau dans la ligne de verrouillage, le vêtement précis, sa couleur, son matériau et sa silhouette. Si deux personnages se confondent, attribuez-leur des positions fixes gauche-droite et des actions distinctes.
La dérive de produit exige un langage géométrique plutôt que des termes d’ambiance. Précisez le type de bouchon, la poignée, les proportions, le positionnement de l’étiquette, le matériau et la couleur. Demandez un seul événement de contact, tel qu’un soulèvement ou un dépôt, et maintenez le produit suffisamment grand pour être lisible. Le guide de cohérence environnementale propose une méthode d’inspection utile pour l’architecture, les accessoires, la direction de la lumière et la continuité spatiale à travers des compositions modifiées.

Un décor modifié et une caméra en mouvement soumettent le même bouchon, le même collier, la même bande ondulée, la même couleur et les mêmes proportions à un test de continuité plus exigeant.
Distinguer l’échec des références de l’échec du mouvement
Arrêtez la vidéo à la première image claire. Si l’identité ou la géométrie est déjà erronée, corrigez les références et les rôles dans le prompt. Si l’ouverture est correcte mais que les images suivantes dérivent, réduisez la complexité de l’action, l’amplitude du mouvement, la trajectoire de la caméra ou la durée. Si tout reste reconnaissable mais que la séquence paraît plate, améliorez alors le rythme, la performance et l’énergie caméra. Modifier simultanément ces trois couches annule toute valeur diagnostique de la génération suivante.
Une sortie Seedance existante distincte, destinée à l’analyse des mains, de la géométrie de l’instrument, du rythme de la performance, de la distance caméra et du résultat global en mouvement.
Échelonner les prises de référence avec Seedance Agent
Transformer des fragments de prompt en un plan de prise contrôlé
La partie la plus difficile de la production multi-référence ne réside que rarement dans la première instruction. Il s’agit plutôt de maintenir, tout au long d’une séquence, l’alignement des rôles attribués aux références, des cadres acceptés, du format d’image, de la direction de la caméra, des validations et des notes de relance. Une instruction copiée-collée peut décrire un plan unique ; elle ne préserve pas automatiquement la raison pour laquelle une référence a été choisie ni la contrainte qui a échoué au quatrième plan.
Seedance Agent commence par le cahier des charges et les ressources sources, propose un scénario et un plan de prises de vue à valider, puis associe systématiquement chaque référence au plan où elle est pertinente. Vous pouvez approuver ce plan avant toute génération payante, comparer les rendus finaux et relancer uniquement la section problématique, sans avoir à reconstruire l’intégralité de la séquence. Le flux de travail vidéo IA multi-modèle explique comment ce transfert s’opère lorsque différents plans bénéficient de modèles distincts.
Utilisez le bon parcours en fonction de la tâche
Utilisez Vidu directement lorsque vous souhaitez tester son modèle Reference to Video actuel, comprendre comment ses paramètres réagissent ou produire un clip contrôlé unique. Utilisez Seedance Agent lorsque la livrable comporte plusieurs plans, implique plusieurs parties prenantes, plusieurs versions ou des échéances précises, et lorsque l’historique de production est aussi important que l’instruction elle-même. Conservez les mêmes libellés de références et les mêmes critères d’acceptation dans les deux cas, afin qu’un élément validé puisse être transféré d’un outil à l’autre sans perdre son sens.
Conclusion
De solides références image-vers-vidéo avec Vidu fonctionnent comme des instructions de production compactes : attribuez à chaque image un rôle précis, limitez l’action représentée, nommez un seul mouvement de caméra, décrivez la scène et répétez les repères de continuité qui doivent impérativement être conservés. Commencez avec le plus petit nombre possible de références compatibles, testez près du cadrage source, et diagnostiquez séparément les problèmes d’identité, de géométrie, de mouvement et d’environnement avant de lancer une nouvelle génération. Lorsque l’idée se transforme en livrable composée de plusieurs plans, soumise à validation et nécessitant des relances sélectives, commencez avec Seedance Agent et intégrez les mêmes libellés de références et critères d’acceptation dans un flux de travail centralisé.
Prêt à essayer par vous-même ?
Mettez en pratique les étapes de ce guide dans Seedance et transformez vos prompts ou images en vidéos abouties en quelques minutes.
Crédits offerts à l'inscription. Forfaits à partir de $20/mois.
Articles associés
D'autres articles dans la même langue à lire ensuite.

Guide de configuration locale MiniMax H3 : ComfyUI, modèles, VRAM et premier rendu
Configurez localement MiniMax H3 avec ComfyUI, choisissez les bons fichiers FL2VA ou Ref2VA, planifiez la mémoire VRAM, placez chaque modèle correctement et effectuez un premier rendu vérifié.
Lire l'article
Générateur vidéo Qwen IA gratuit : guide d’accès, de test et d’exportation
Découvrez où accéder aux outils vidéo Qwen, vérifiez les limites gratuites, testez la génération vidéo à partir de texte et d’images, examinez les exports disponibles, puis transférez une idée validée vers Seedance Agent.
Lire l'article
Générateur vidéo IA SnapGen gratuit : testez-le avant de vous engager
Découvrez comment vérifier l’accès gratuit à SnapGen, tester la génération vidéo à partir de texte et d’images, examiner les exports et les coûts, puis intégrer un concept validé dans Seedance Agent.
Lire l'article