- Blog
- So erstellen Sie ein KI-Video, das einer mehrstufigen Aktion folgt
So erstellen Sie ein KI-Video, das einer mehrstufigen Aktion folgt

KI-Videos verarbeiten oft eine sichtbare Aktion gut, verlieren jedoch die Handlung, sobald die Anfrage fünf Schritte umfasst. Ein Subjekt könnte beispielsweise gießen, bevor es die Kanne aufnimmt; ein Objekt könnte zwischen den Schritten in seinen Ausgangszustand zurückkehren; oder der Clip könnte seine gesamte Dauer mit der Ausgangsposition verbringen. Die zuverlässige Lösung besteht darin, die Idee in beobachtbare Zustandsänderungen umzuwandeln, jeder Aktion ausreichend Bildschirmzeit zuzuweisen und die Abfolge in separate Aufnahmen zu unterteilen, wenn ein einzelner Clip sie nicht sauber wiedergeben kann.
In dieser Anleitung erfahren Sie, wie Sie ein KI-Video so steuern, dass es einer mehrstufigen Aktion folgt – ohne die Prompt wie ein Drehbuch zu behandeln. Als durchgängiges Beispiel dient eine Barista, die Kaffeebohnen abmisst, Wasser eingießt, den Filter entfernt und die fertige Tasse präsentiert. Dieselbe Methode lässt sich auf Montagedemonstrationen, Rezepte, Produktanleitungen, Bastelanleitungen sowie kurze narrative Sequenzen übertragen.

AI Overview
Wie stelle ich sicher, dass ein KI-Video die Schritte in der richtigen Reihenfolge ausführt?
Formulieren Sie jeden Schritt als sichtbare physische Aktion, definieren Sie den Zustand vor und nach dieser Aktion und verbinden Sie die Aktionen mithilfe expliziter Reihenfolgewörter oder Zeitstempel. Halten Sie die Abfolge kurz genug, um sie problemlos innerhalb der Clip-Dauer abzubilden.
Sollte eine mehrstufige Aktion in einem einzigen Clip generiert werden?
Verwenden Sie einen Clip für zwei oder drei eng miteinander verbundene Aktionen, die bequem Platz finden. Teilen Sie längere, empfindliche oder zustandsverändernde Abfolgen in separate Einstellungen auf und übernehmen Sie den zuletzt akzeptierten Frame als Ausgangspunkt für die nächste Aufnahme.
Warum überspringt das Modell die mittlere Aktion?
Möglicherweise enthält die Prompt zu viele Aktionen für die zur Verfügung stehende Zeit, oder der mittlere Zustand ist visuell mehrdeutig. Geben Sie diesem Schritt eine konkrete Objektinteraktion, mehr Zeit und ein klares Ergebnis.
Wie kann ich Konsistenz von Subjekt und Objekten gewährleisten?
Fixieren Sie das Referenzbild, die Kleidung, die Requisiten, die Kameraposition, die Beleuchtung und den Ausgangszustand. Verwenden Sie bei der nächsten Aufnahme einen bereits akzeptierten Randframe, wenn diese exakt dort beginnen muss, wo die vorherige endete.
Atomare Schritte und Zustände definieren
Beginnen Sie mit einem Ziel in Alltagssprache und reduzieren Sie es dann auf Aktionen, die eine Kamera tatsächlich wahrnehmen kann. „Kaffee zubereiten“ ist kein Aktionsplan. „Sie gießt Bohnen in die Mühle“ hingegen schon. Vermeiden Sie es, Absicht, Emotion, Kamerabewegung und mehrere Objektänderungen in einem Satz zu kombinieren. Jede Zeile sollte genau einen Akteur, ein Verb, ein Objekt und ein sichtbares Ergebnis enthalten.
Erstellen Sie vor dem Schreiben der Prompt ein Arbeitsblatt für Zustandsübergänge:
| Schritt | Ausgangszustand | Sichtbare Aktion | Endzustand | Kontinuitätsfixierung |
|---|---|---|---|---|
| 1 | Bohnen in der Messlöffel; Mühle leer | Barista gießt Bohnen in die Mühle | Messlöffel leer; Bohnen in der Mühle | Gleiche Schürze, Arbeitsfläche, Tasse |
| 2 | Kanne angehoben; trockenes Kaffeepulverbett | Barista gießt langsam im Kreis ein | Kaffeepulverbett blüht auf | Gleiche Hand, Kanne, Kamera |
| 3 | Gießvorgang abgeschlossen; Filter auf der Karaffe | Barista stellt die Kanne ab und hebt den Filter an | Gefüllte Tasse bereit | Flüssigkeitsstand und Position der Requisiten |
| 4 | Tasse auf der Arbeitsfläche | Barista schiebt die Tasse nach vorne | Fertige Tasse präsentiert | Gleiche Beleuchtung und Hintergrund |
Der Endzustand ist ebenso wichtig wie die Aktion selbst. Er signalisiert dem Generator, was beim Beginn der nächsten Aktion unverändert bleiben muss. Falls sich eine Platte, ein Werkzeug, ein Kleidungsstück oder ein Produkt in seiner Ausrichtung ändert, notieren Sie dieses Ergebnis explizit. Diese Disziplin verbessert auch einen einfachen Text-zu-Video-Workflow, da die Prompt Beweise statt vager Absichten beschreibt.

Aktionen an die verfügbare Dauer anpassen
Eine Abfolge scheitert, wenn ihr „Aktionsbudget“ ihr „Zeitbudget“ übersteigt. Berücksichtigen Sie Zeit für Vorahnung, Ausführung und Abklingen. Eine Hand muss die Kanne erreichen, bevor sie eingegossen wird; die Kanne muss zum Stillstand kommen, bevor sie abgestellt wird. Diese Übergangsphasen sind kurz, verhindern aber ein „Teleportieren“.
Für einen fünfsekündigen Clip sollten Sie sich auf eine Hauptaktion oder zwei einfache, miteinander verbundene Aktionen beschränken. In acht bis zehn Sekunden können zwei oder drei Aktionen funktionieren, sofern die Kamera stabil bleibt und die Objekte leicht erkennbar sind. Vier bewusst gestaltete Schritte erfordern in der Regel mehrere Aufnahmen. Ein schneller Montage-Rhythmus kann mehr Ereignisse zeigen, beweist aber nicht, dass eine kontinuierliche Aktion vollständig ausgeführt wurde.
Weisen Sie grobe Zeitfenster erst nach Vereinfachung der Abfolge zu. Beispiel: 0–2 Sekunden, Kanne anheben; 2–6 Sekunden, langsam im Kreis eingießen; 6–8 Sekunden, Kanne wieder auf die Arbeitsfläche stellen. Am Ende sollte ein klarer Ruhezustand erreicht sein. Exakte Zeitstempel dienen lediglich als Orientierung – nicht als framegenaue Schnittanweisungen – bewerten Sie daher die sichtbare Reihenfolge, nicht die Zahlen.
Falls die Dauer fest vorgegeben ist, entfernen Sie zunächst dekorative Bewegungen. Eine Kameraorbitierung, aufsteigender Dampf, Hintergrundgäste und komplexe Handbewegungen konkurrieren alle um die verfügbare Bewegungskapazität. Fixieren Sie die Kamera für den ersten erfolgreichen Take; fügen Sie erst nach Stabilisierung der Aktionsreihenfolge eine zurückhaltende Annäherung hinzu.
Eine sequenzielle Aktions-Prompt erstellen
Beschreiben Sie die stabile Szene einmal, dann die geordneten Aktionen, dann die Kamera- und Qualitätsanforderungen. Dadurch bleibt die Prompt gut lesbar und eine lange Stilvorspanne verdeckt nicht die eigentliche Aufgabe.
Verwenden Sie diese sofort einsatzbereite Vorlage:
[Subjekt und feste Erscheinung] in [stabiler Umgebung].
Ausgangszustand: [Positionen von Händen, Werkzeugen und Objekten].
Zuerst: [eine sichtbare Aktion und ihr Ergebnis].
Dann: [eine sichtbare Aktion und ihr Ergebnis].
Schließlich: [eine sichtbare Aktion und der endgültige Ruhezustand].
Die Aktionen erfolgen in dieser exakten Reihenfolge mit natürlichen Handkontakten und ohne Zurücksetzen von Objekten.
[Kameraausschnitt und -bewegung]. [Beleuchtung und visueller Stil].
```Für den Kaffee-Clip: „Eine Barista in einer olivfarbenen Schürze steht hinter einer hölzernen Kaffeetheke. Ausgangszustand: Ihre rechte Hand hält einen Gänsehals-Kessel über ein trockenes Kaffeepulverbett. Zunächst beginnt sie mit einem langsamen kreisförmigen Gießvorgang. Dann blüht der Kaffee auf, während sie den kontrollierten Kreis fortsetzt. Schließlich stellt sie den Kessel ab und legt ihn auf die Theke. Die Aktionen erfolgen genau in dieser Reihenfolge. Fester Mittelschnitt, warmes natürliches Fensterlicht.“
Positive Beschreibungen wirken meist besser als eine lange Liste von Verboten. Formulieren Sie stattdessen „die Tasse bleibt auf der linken Seite der Kanne“, statt sich allein auf „bewegen Sie die Tasse nicht“ zu verlassen. Falls die Ausgangskomposition wichtig ist, beginnen Sie mit [image-to-video](/de/image-to-video) und wählen Sie eine Referenz aus, die bereits alle wesentlichen Requisiten enthält.
## Generieren Sie einen einzigen Clip oder teilen Sie ihn in mehrere Szenen auf
Generieren Sie einen einzigen Clip, wenn dieselbe Person eine kontinuierliche Aktion an einem Ort ausführt und die Kamera sämtliche Ergebnisse beobachten kann. Teilen Sie die Sequenz auf, wenn ein Objekt transformiert wird, die Person ihre Position wechselt, ein neues Werkzeug hinzukommt oder ein einzelner Schritt wiederholt verschwindet.
Eine praktische Entscheidungsregel ist einfach: Wenn Sie die Sequenz nicht mit drei Verben und einem stabilen Ausgangsbild beschreiben können, verwenden Sie mehr als einen Clip. Clip eins endet möglicherweise damit, dass der Kessel auf der Theke ruht. Clip zwei beginnt ab diesem akzeptierten Endframe und zeigt das Entfernen des Filterhalters. So erhält jede Generierung eine kleinere Aufgabe, während der Eindruck eines durchgängigen Workflows erhalten bleibt.
Vermeiden Sie es, einen überlasteten Prompt immer wieder neu zu generieren. Nach zwei oder drei Fehlschlägen mit demselben fehlenden Schritt verkürzen Sie die Einheit. Das [Pika-Mehrfach-Keyframe-Tutorial](/de/blog/pika-multiple-keyframe-video-tutorial) ist hilfreich, wenn das Tool explizite visuelle Wegpunkte unterstützt. Für umfassendere Kontrolle über Identität und Umgebung nutzen Sie die Methoden aus dem [Leitfaden zur Konsistenz bei KI-Videos](/de/blog/best-ai-video-generator-for-consistency).

## Gewährleisten Sie Kontinuität zwischen den Schritten
Die Grenze zwischen Clips ist oft der Punkt, an dem Mehrschritt-Workflows scheitern. Speichern Sie den letzten Frame erst dann, wenn Hände, Requisiten und Protagonist in einem neutralen, gut erkennbaren Zustand sind. Ein Frame mit Bewegungsunschärfe, einem halb verdeckten Werkzeug oder Fingern, die ein Objekt kreuzen, führt bei der nächsten Generierung zu unsicherer Geometrie.
Übertragen Sie fünf feste Parameter in den nächsten Clip: Identität der Person, Kleidung, zentrales Objekt, Umgebung und Kamerarichtung. Notieren Sie außerdem die Variable, die sich ändern darf. Im Kaffee-Beispiel darf der Flüssigkeitsstand steigen, doch Design der Tasse, Schürze, Arbeitsplatte und Lichtrichtung müssen unverändert bleiben.
Wenn Sie einen Grenzframe verwenden, beschreiben Sie ihn als Ausgangszustand – wiederholen Sie nicht die gesamte vorherige Aktion. Der nächste Prompt sollte lauten: „Der Kessel ruht auf der rechten Seite der Theke und der gefüllte Filterhalter befindet sich weiterhin über der Kanne. Die Barista hebt den Filterhalter gerade nach oben.“ Ein erneutes Abspielen des Gießvorgangs verleitet das Modell dazu, diesen von Neuem zu starten.
Dieses echte Seedance-Beispiel dient als eigenständiger Bewegungs-Referenzrahmen zur Beurteilung von Kontakt, Kamerastabilität und Abklingphase. Es ist keine Bestätigung dafür, dass diese genaue Kaffee-Sequenz in einem Durchlauf generiert wurde.
```official-video
src=https://r2.seedance.tv/blog/runway-failed-generation-credits-refund/seedance-coffee-motion-control-v1.mp4
poster=https://r2.seedance.tv/blog/runway-failed-generation-credits-refund/seedance-coffee-motion-control-poster-v1.jpg
label=Seedance motion-control reference for action review
Überprüfen und korrigieren Sie die Sequenz
Sehen Sie sich die Sequenz zunächst in normaler Geschwindigkeit an. Stellen Sie sicher, dass die Aktionen in der richtigen Reihenfolge erfolgen und jeder Schritt den erforderlichen Zustand erzeugt. Prüfen Sie anschließend framegenau die Bereiche um Handkontakt und Schnittstellen. Selbst eine optisch gelungene Aufnahme gilt als fehlgeschlagen, wenn der Deckel sich öffnet, bevor die Hand ihn berührt, oder ein gefüllter Behälter plötzlich leer ist.
Verwenden Sie eine kompakte Akzeptanz-Checkliste:
- Jede erforderliche Aktion tritt genau einmal und in der richtigen Reihenfolge auf.
- Anfangs- und Endzustand sind visuell klar erkennbar.
- Die Hände berühren das vorgesehene Objekt, ohne zu verschmelzen oder die Seite zu wechseln.
- Requisiten verschwinden nicht, verdoppeln sich nicht, setzen sich nicht zurück oder ändern ihr Design.
- Kamerarichtung und Bildposition der Person bleiben konsistent.
- Der letzte Frame eignet sich als sauberer Übergangspunkt oder Schnittpunkt.
Korrigieren Sie die kleinste fehlerhafte Einheit. Fehlt Schritt zwei, gewähren Sie ihm mehr Zeit oder isolieren Sie ihn in einem neuen Clip. Bei Identitätsverschiebung stärken Sie die Referenz und reduzieren die Kamerabewegung. Transformiert sich ein Objekt, wählen Sie einen klareren Grenzframe und beschreiben Sie dessen Geometrie neu. Fühlt sich der Schnitt abrupt an, fügen Sie stattdessen eine Halbsekunden-Abklingpose ein, anstatt die gesamte Sequenz neu zu generieren.
Seedance Agent ist nützlich, wenn die Aufgabe mehrere Generationsdurchläufe erfordert: Es kann das Status-Arbeitsblatt, die Referenzen, die Clip-Reihenfolge, die Überprüfungsnotizen und gezielte Neugenerierungen zusammenhalten. Damit richtet sich die Freigabe auf beobachtbare Übergänge statt darauf, ob ein ansprechender Clip „richtig anfühlt“.

Fazit
Um sicherzustellen, dass KI-Videos einer mehrstufigen Aktion folgen, zerlegen Sie die Idee in atomare Verben, definieren Sie jeden Start- und Endzustand, verteilen Sie die Aktionen entsprechend der Clip-Länge und teilen Sie die Sequenz auf, bevor sie überlastet wird. Bewahren Sie Kontinuität durch saubere Grenzframes, stabile visuelle Fixpunkte und eine Überprüfungscheckliste, die nicht nur den Stil, sondern vor allem die korrekte Reihenfolge prüft. Sobald Sie bereit sind, eine längere Aktionskette zu planen, zu generieren, zu vergleichen und zu korrigieren, bauen Sie den Workflow in Seedance Agent auf.
Bereit, es selbst auszuprobieren?
Setzen Sie die Schritte aus diesem Leitfaden direkt in Seedance um und verwandeln Sie Prompts oder Bilder in wenigen Minuten in fertige Videos.
Kostenlose Credits bei der Anmeldung. Tarife ab $28/Monat.
Verwandte Artikel
Weitere Beiträge in derselben Sprache, die Sie als Nächstes lesen könnten.

Pictory – Video mithilfe von Text bearbeiten: Eine Aufnahme anhand ihres Transkripts zuschneiden
Laden Sie eine Aufnahme in Pictory hoch, überprüfen Sie ihr Transkript, löschen Sie Text, um das Video zu schneiden, beheben Sie Sprung-Schnitte und Untertitel sowie fügen Sie B-Roll-Material hinzu, um eine saubere Endversion zu exportieren.
Artikel lesen
ElevenLabs Voice Changer – Video-Tutorial: Stimme ersetzen und Performance bewahren
Transformieren Sie den Dialog eines Videos mit dem ElevenLabs Voice Changer, bewahren Sie Emotion und Timing, stellen Sie die Lippsynchronisation wieder her, beheben Sie Artefakte und erstellen Sie einen konsistenten Mix.
Artikel lesen
Runway Aleph Green Screen: Erstellen eines ausschneidbaren Motivs und einer sauberen Hintergrundplatte
Verwandeln Sie normales Filmmaterial mithilfe von Runway Aleph 2.0 in ein Greenscreen-Asset, formulieren Sie eine präzise Prompt-Anfrage, führen Sie die Schlüsselung durch, beheben Sie Kantenprobleme und erstellen Sie eine saubere Hintergrundplatte.
Artikel lesen