Vidu-Referenz für Videoprompts: Formel, Beispiele und Konsistenzkorrekturen

E
Emma Chen·10 Min. Lesezeit·Sep 8, 2026
Auf X teilen
Vidu-Referenz für Videoprompts: Formel, Beispiele und Konsistenzkorrekturen

AI Overview

Was sollte ein Vidu-Referenz-zu-Video-Prompt enthalten?

Weisen Sie jedem Bild eine Rolle zu, beschreiben Sie eine sichtbare Aktion, benennen Sie das Kameraverhalten, definieren Sie Szene und Beleuchtung und geben Sie an, was unverändert bleiben muss. Machen Sie jede Anweisung in dem fertigen Clip überprüfbar.

Wie viele Referenzbilder kann Vidu verwenden?

Die aktuellen Erstellungsseiten von Vidu geben Unterstützung für ein bis sieben Referenzbilder an. Verwenden Sie ausschließlich Bilder, die eine klare Identität, ein Objekt, eine Garderobe, eine Umgebung oder einen Stilrahmen hinzufügen.

Wie halte ich einen Charakter in Vidu konsistent?

Verwenden Sie klare, kompatible Ansichten und wiederholen Sie eine kurze Identitätsfestlegung, die Gesicht, Haare, Outfit, Silhouette und charakteristische Requisiten umfasst. Reduzieren Sie konkurrierende Subjekte, mehrdeutige Pronomen und unnötige Kamerawechsel.

Kann Seedance Agent einen Mehrfachreferenz-Workflow verwalten?

Ja. Seedance Agent kann aus einem kurzen Briefing und Referenzbildern einen überprüfbaren Shotplan erstellen, alle Einschränkungen pro Shot beibehalten und nur die Ausgaben erneut generieren, die bei der Kontinuitäts- oder Bewegungsprüfung fehlschlagen.

Was Vidu Reference to Video-Prompts steuern müssen

Behandeln Sie jedes Bild als Produktionsasset

Personen, die nach Vidu-Referenz-zu-Video-Prompts suchen, benötigen ein Prompt, das dem Modell erklärt, warum jedes hochgeladene Bild existiert. Der aktuelle Workflow von Vidu akzeptiert Referenzen für Charaktere, Objekte und Szenen; seine Erstellungsseiten geben Unterstützung für ein bis sieben Bilder an. Sieben schwache Referenzen sind nicht automatisch besser als drei klare.

Bevor Sie schreiben, geben Sie jedem Bild eine private Bezeichnung: Charakter A, Charakter B, Produkt, Ort, Garderobe oder Stil. Entscheiden Sie dann, ob das Bild ein fester Kontinuitätsanker oder ein lockerer visueller Einfluss ist. Ein Frontalporträt kann die Gesichtsidentität festlegen; eine Ganzkörperansicht schützt Silhouette und Kleidung; ein Ortsbild legt Architektur und Licht fest. Falls zwei Bilder widersprüchlich sind, kann das Prompt den Konflikt nicht zuverlässig beheben.

Der Referenz-zu-Video-Arbeitsbereich ist der direkteste Ort, um diese Art Aufgabe zu organisieren. Falls Sie nur ein Quell-Still haben, bietet der Bild-zu-Video-Arbeitsbereich eine einfachere Grundlage, bevor Sie weitere Einschränkungen hinzufügen.

Eine Frau im senfgelben Regenmantel wartet mit einem weißen Windhund und einem kobaltblauen Koffer neben einem fahrenden Zug

Ein fertiges, referenzgeführtes Konzept, das speziell für diesen Leitfaden erstellt wurde. Die Frau, der senfgelbe Regenmantel, der Windhund mit einem schwarzen Ohr, der kobaltblaue Koffer, der nasse Bahnsteig und der silberne Zug sind die Kontinuitätsanker.

Definieren Sie den Erfolg vor der Generierung

Formulieren Sie eine fünfpunktige Akzeptanzprüfung neben dem Prompt: dieselbe Frau, dieselbe Fellzeichnung des Hundes, derselbe Mantel, dieselbe Koffer-Geometrie und derselbe Küstenbahnhof. Bewegung und Bildaufbau dürfen sich ändern; diese Anker dürfen es nicht. Damit wird „es fühlt sich falsch an“ in eine präzise Korrektur wie „das schwarze rechte Ohr des Hundes wiederherstellen und den hellbraunen Kofferriemen beibehalten“ umgewandelt.

Die Fünf-Teile-Prompt-Formel

1. Referenzrollen und Kontinuitätsanker

Beginnen Sie mit einer kompakten Besetzungsliste: „Bild 1 zeigt das Gesicht der Frau und ihre Bobfrisur; Bild 2 ihren senfgelben Regenmantel; Bild 3 den weißen Windhund mit einem schwarzen Ohr; Bild 4 den kobaltblauen Koffer mit einem hellbraunen Tragegurt.“ Vermeiden Sie mehrdeutige Pronomen, wenn zwei mögliche Subjekte sichtbar sind.

2. Eine Aktion mit lesbarer Anfangs- und Endphase

Beschreiben Sie eine einzelne Aktion, die in die gewünschte Dauer passt: „Der Zug hält, die Frau kniet nieder, um die Leine anzuklicken, und steht auf, sobald sich die Türen öffnen.“ Das ist kontrollierbarer, als Ankunft, Einsteigen, Gespräch, Kameraorbit und Abfahrt in einem kurzen Clip zu fordern. Geben Sie der Aktion eine Endpose, damit die letzte Sekunde nicht in zufällige Bewegung zerfällt.

3. Kamera, Szene, Licht und Festlegungszeile

Nennen Sie die Einstellungsgröße und eine Kamerabewegung: „mittlere Weitwinkelaufnahme auf Augenhöhe, langsames Heranfahren.“ Schließen Sie mit einer Festlegungszeile ab: „Gesichtsidentität, Fellzeichnung des Hundes, Mantelfarbe, Kofferform, Bahnhofsarchitektur und Bildrichtung bewahren; keine doppelten Gliedmaßen, ersetzten Requisiten, Texte oder Logos.“

Dasselbe Frau klickt dieselbe Leine am Halsband des Windhunds neben dem kobaltblauen Koffer an

Ein zweiter fertiger Frame ändert Aktion und Kameradistanz, behält aber die ausgewählten Anker für Charakter, Tier, Garderobe, Gepäck und Ort bei.

Kopier- und Einfüge-Vidu Reference to Video-Prompts

Charakter-, Tier- und Orts-Prompt

„Verwenden Sie Referenz 1 für das Gesicht der Frau, ihre kurze schwarze Bobfrisur und ihre Proportionen; Referenz 2 für den senfgelben Regenmantel, schwarze Stiefel und den Rucksack; Referenz 3 für den schlanken weißen Windhund mit einem schwarzen rechten Ohr; Referenz 4 für den kobaltblauen Hartshell-Koffer mit einem einzigen hellbraunen vertikalen Gurt; und Referenz 5 für den nassen Küstenbahnsteig. Ein silberner Zug gleitet von rechts nach links herein. Die Frau kniet nieder, klickt die braune Leine am Halsband des Hundes an, blickt zur sich öffnenden Tür und steht auf. Mittlere Weitwinkelaufnahme auf Augenhöhe mit langsamem Heranfahren, weiches Morgenlicht nach Regen, realistische Bewegung. Bewahren Sie jeden genannten Anker, die beiden Hände der Frau, die Anatomie des Hundes und die Bildrichtung. Keine neuen Personen im Vordergrund, kein Text, kein Logo.“

Falls das Ergebnis Probleme bereitet, entfernen Sie zunächst ein nicht wesentliches Garderoben- oder Hintergrundbild, bevor Sie weiteren Text hinzufügen.

Produktgeometrie-Prompt

„Verwenden Sie Referenz 1 als exaktes Produkt: mattes korallen-oranges Isolierflasche, schwarze Schleifenkappe, schmale silberne Kragenleiste, blasscremefarbene mehrzeilige Wellenband-Applikation, unveränderte Proportionen. Verwenden Sie Referenz 2 für die nasse Basalt-Wasserfall-Umgebung. Die Hand eines Wanderers greift hinein und hebt die Flasche an, während Wasser um den Boden herum spritzt. Niedrige Nahansicht mit subtiler Vorwärtsbewegung, scharfes Produkt vor sanft unscharfem Wasserfall, kühler Morgennebel und warmem Randlicht. Bewahren Sie in jedem Einzelbild Form der Kappe, Breite des Kragens, Position der Wellenband-Applikation, Oberflächenbeschaffenheit und Farbe unverändert. Kein Etikettentext, kein Logo, keine Dellen, keine doppelte Flasche, keine verformten Finger und keine Farbverschiebung.“

Eine Hand greift nach einer korallenfarbenen Isolierflasche neben einem Wasserfall

Ein fertiger Produktshot macht Geometrie, Farbe, Kappe-Konstruktion, Handkontakt und Umgebungs-Bewegung einfach inspizierbar.

Prompt für die Interaktion zweier Figuren

„Referenz 1 ist Figur A, ein Koch mit einer Kohlefarbenen Schürze. Referenz 2 ist Figur B, ein Radfahrer mit einer Kobaltblauen Jacke. Referenz 3 ist die kleine offene Küche mit grünen Fliesen. Figur A schiebt eine keramische Schüssel über die Theke; Figur B fängt sie mit beiden Händen und lächelt. Feste Mittelaufnahme mit zwei Personen, sanfte Schärfentiefe-Verschiebung (Rack Focus) vom Schüssel zum Gesicht von Figur B, warmes Fensterlicht. Halten Sie Gesichter, Frisuren, Outfits, relative Körpergröße, Muster der Schüssel, Anordnung der Theke sowie linke/rechte Positionen konstant. Kein Gesichtstausch, keine zusätzlichen Finger, keine Kleidungswechsel, kein Dialogtext und kein Kamera-Schnitt.“

Weitere Beispiele dazu, wie sich ein Referenzsystem von einem Einzel-Shot-Generator unterscheidet, finden Sie im Vidu-Alternativen-Leitfaden. Dieser hilft dabei, Zugang und Produktauswahl vom hier behandelten Prompt-Design-Problem zu trennen.

Wählen und beschriften Sie Referenzbilder

Verwenden Sie ergänzende Ansichten – keine nahezu identischen Duplikate

Ein nützliches Figuren-Set enthält eine Frontalaufnahme, eine Dreiviertelansicht und eine Ganzkörperaufnahme mit komplettem Outfit. Ein Produkt-Set kann einen Hero-Winkel, eine Seitenansicht und eine Aufnahme mit Handkontakt nutzen. Für einen Ort wählen Sie ein Weitwinkelbild plus ein Detail, das auch bei Nahaufnahmen erkennbar bleiben soll.

Beschneiden Sie störende Hintergrundelemente, bewahren Sie aber alle Details zur Maßstabsbestimmung. Vermeiden Sie starke Beauty-Filter, extreme Verzerrungen, verdeckte Hände, nicht lesbare Produktkonturen und Benutzeroberflächen-Elemente („interface chrome“). Geben Sie gespeicherten Referenzen stabile Namen wie MAYA_YELLOW_COAT oder CORAL_BOTTLE_V1.

Passen Sie den Prompt an den Bildausschnitt an

Wenn die Quelle ein enger Porträtausschnitt ist, fordern Sie keine schnelle Ganzkörper-Drehung mit einem bisher nicht sichtbaren Outfit. Beginnen Sie nahe am Referenz-Framing, bestätigen Sie Identität und Geometrie, und erweitern Sie dann Abstand oder Bewegung der Kamera jeweils nur eine Variable auf einmal. So lässt sich genau erkennen, welche Änderung zu einer Abweichung geführt hat.

Abgeschlossenes Station-Motion-Beispiel zur Kontinuitätsprüfung

Ein bestehendes redaktionelles Seedance-Ergebnis, kein offizieller Vidu-Benchmark. Prüfen Sie beim sich bewegenden Bild Gesicht, Kleidung, Fußkontakt, Hintergrundverkehr und Endpose – während Kamera und Menschenmenge sich bewegen.

Beheben Sie Identitäts-, Produkt- und Szenen-Drift

Beheben Sie Identitätsprobleme vor der Stilgestaltung

Falls sich das Gesicht bei größerer Entfernung verändert, rücken Sie die Kamera näher heran, reduzieren Sie die Kopfdrehung, fügen Sie eine stärkere Dreiviertel-Referenz hinzu und verkürzen Sie die Aktion. Wiederholen Sie ausschließlich die wichtigsten Gesichtsanker. Falls sich die Kleidung ändert, benennen Sie das betreffende Kleidungsstück, dessen Farbe, Material und Silhouette einmal in der Cast-Liste und erneut in der Lock-Zeile. Falls sich zwei Figuren vermischen, weisen Sie ihnen feste linke/rechte Positionen und unterschiedliche Aktionen zu.

Produkt-Drift erfordert geometrische Beschreibungen statt Stimmungswörter. Geben Sie Kappe-Typ, Griff, Proportionen, Etikettenposition, Material und Farbe präzise an. Fordern Sie ein einzelnes Kontakt-Ereignis an – etwa das Anheben oder Abstellen – und halten Sie das Produkt groß genug, um es klar erkennen zu können. Der Leitfaden zur Umgebungs-Konsistenz bietet eine nützliche Inspektionsmethode für Architektur, Requisiten, Licht-Richtung und räumliche Kontinuität über verschiedene Kompositionen hinweg.

Die gleiche korallenfarbene Flasche bleibt auf einem sich bewegenden Kiesradweg erkennbar

Eine geänderte Umgebung und eine sich bewegende Kamera stellen dieselbe Kappe, denselben Kragen, dasselbe Wellenband, dieselbe Farbe und dieselben Proportionen einer strengeren Kontinuitätsprüfung.

Trennen Sie Referenz-Fehler von Bewegungs-Fehlern

Halten Sie die Ausgabe im ersten eindeutig erkennbaren Frame an. Ist Identität oder Geometrie bereits fehlerhaft, beheben Sie Referenzen und Rollenbeschreibungen im Prompt. Ist der Start korrekt, driftet aber später die Darstellung, reduzieren Sie Komplexität der Aktion, Bewegungsamplitude, Kameraweg oder Dauer. Bleibt alles erkennbar, wirkt der Clip jedoch flach, verbessern Sie Timing, Performance und Kamera-Energie. Eine gleichzeitige Änderung aller drei Ebenen zerstört den diagnostischen Wert der nächsten Generierung.

Abgeschlossenes Performance-Beispiel zur Prüfung von Handbewegung, Instrumentengeometrie, Timing, Kameraabstand und dem vollständigen bewegten Ergebnis

Ein eigenständiges, bestehendes Seedance-Ergebnis zur Überprüfung von Händen, Instrumentengeometrie, Performance-Timing, Kameraabstand und dem kompletten bewegten Resultat.

Skalieren Sie Referenzaufnahmen mit Seedance Agent

Wandeln Sie Prompt-Fragmente in einen kontrollierten Shot-Plan um

Der schwierige Teil der Mehrfach-Referenz-Produktion ist selten der erste Prompt. Vielmehr besteht die Herausforderung darin, Referenzrollen, akzeptierte Frames, Seitenverhältnis, Kamerarichtung, Freigaben und Nachbesserungsnotizen über eine gesamte Sequenz hinweg konsistent zu halten. Ein eingefügter Prompt kann eine einzelne Einstellung beschreiben; er bewahrt jedoch nicht automatisch, warum eine Referenz ausgewählt wurde oder welcher Constraint bei Einstellung vier versagte.

Seedance Agent beginnt mit dem Briefing und den Quell-Assets, schlägt ein Drehbuch und einen Aufnahmeplan zur Überprüfung vor und verknüpft jede Referenz stets mit derjenigen Einstellung, für die sie relevant ist. Sie können den Plan vor der kostenpflichtigen Generierung freigeben, die fertigen Ergebnisse vergleichen und ausschließlich den schwachen Abschnitt neu generieren – statt die gesamte Sequenz neu aufzubauen. Der Multi-Modell-KI-Videoworkflow erläutert, wie dieser Übergang funktioniert, wenn unterschiedliche Einstellungen von verschiedenen Modellen profitieren.

Wählen Sie die richtige Methode für die jeweilige Aufgabe

Verwenden Sie Vidu direkt, wenn Sie das aktuelle Reference to Video-Modell testen, dessen Reaktion auf Einstellungen kennenlernen oder einen einzelnen kontrollierten Clip erstellen möchten. Nutzen Sie Seedance Agent, wenn das Endprodukt mehrere Einstellungen, Stakeholder, Versionen oder Deadlines umfasst und die Produktionsdokumentation genauso wichtig ist wie der Prompt selbst. Behalten Sie in beiden Fällen dieselben Referenzbezeichnungen und Freigabekriterien bei, damit ein freigegebenes Asset problemlos zwischen den Tools wechseln kann, ohne seine Bedeutung zu verlieren.

Fazit

Starke Vidu-Referenzen für Videoprompts wirken wie kompakte Produktionsanweisungen: Weisen Sie jedem Bild eine klare Rolle zu, begrenzen Sie die Aktion, benennen Sie genau eine Kamerabewegung, beschreiben Sie die Szene und wiederholen Sie die Kontinuitätsanker, die unbedingt erhalten bleiben müssen. Beginnen Sie mit der geringstmöglichen Anzahl kompatibler Referenzen, testen Sie nahe am ursprünglichen Framing und diagnostizieren Sie Identität, Geometrie, Bewegung und Umgebung separat, bevor Sie eine weitere Generierung starten. Sobald die Idee zu einem mehrteiligen Endprodukt mit Freigaben und gezielten Nachbesserungen wird, beginnen Sie mit Seedance Agent und übernehmen Sie dieselben Referenzbezeichnungen und Freigabekriterien in einen zentral verwalteten Workflow.

Bereit, es selbst auszuprobieren?

Setzen Sie die Schritte aus diesem Leitfaden direkt in Seedance um und verwandeln Sie Prompts oder Bilder in wenigen Minuten in fertige Videos.

Kostenlose Credits bei der Anmeldung. Tarife ab $20/Monat.