MiniMax H3-Multi-Keyframe-Workflow: Steuerung von Timing, Kontinuität und Übergängen

E
Emma Chen·9 Min. Lesezeit·Sep 4, 2026
Auf X teilen
MiniMax H3-Multi-Keyframe-Workflow: Steuerung von Timing, Kontinuität und Übergängen

KI-Überblick

Unterstützt MiniMax H3 mehrere Keyframes?

Ja. In der lokalen ComfyUI können Sie MiniMaxH3AddGuide-Knoten verkettet und Bilder oder Audio an ausgewählten Frame-Indizes verankern. Der einfachere gehostete Weg konzentriert sich auf den ersten und letzten Frame sowie Referenzen.

Wie viele Keyframes sollte ein MiniMax H3-Video verwenden?

Verwenden Sie die geringste Anzahl an Ankerpunkten, die die erforderlichen Story-Zustände definieren: üblicherweise einen Einstieg, ein oder zwei Übergangsphasen und einen Abschluss. Zusätzliche widersprüchliche Frames können harte Morphing-Effekte erzeugen.

Wie behält man denselben Charakter zwischen Keyframes bei?

Wiederverwenden Sie eine einzige Identitätsreferenz, halten Sie Beschreibungen von Kleidung und Umgebung stabil, und stellen Sie sicher, dass jeder Keyframe in Bezug auf Objektgröße, Beleuchtung, Blickrichtung des Objektivs und Bildposition kompatibel ist.

Ist ComfyUI oder Seedance Agent besser für diesen Workflow geeignet?

ComfyUI bietet präzise Steuerung über Frame-Indizes und Knoten. Seedance Agent ist der einfachere Weg für Shot-Planung, Referenzorganisation, Freigaben und das erneute Ausführen nur des fehlgeschlagenen Abschnitts.

Was ein MiniMax H3-Multi-Keyframe-Workflow tatsächlich steuert

Ein MiniMax H3-Multi-Keyframe-Workflow teilt dem Modell mit, welche visuellen Zustände zu bestimmten Zeitpunkten relevant sind. Ein Keyframe besitzt eine feste Position auf der Zeitachse; ein Referenzbild definiert Identität, Stil, Bewegung oder Umgebung – ohne zwangsläufig exakt einem Frame zu entsprechen.

Keyframes im Vergleich zu gewöhnlichen Referenzen

Verwenden Sie einen Keyframe, wenn die Komposition zu einem definierten Zeitpunkt wiedererkennbar sein muss: z. B. eine geschlossene Schachtel am Anfang, eine halb geöffnete Lasche in der Mitte oder eine vollständige Enthüllung am Ende. Verwenden Sie eine Referenz, wenn derselbe Darsteller, dasselbe Produkt, derselbe Raum, dieselbe Kostümierung oder dasselbe Farbsystem über wechselnde Kompositionen hinweg erhalten bleiben müssen. Der MiniMax H3-Generator unterstützt videobasierte Erstellung mit vielen Referenzen, während ein lokaler Graph die Timing-Steuerung direkter offenlegt.

Wenn jedes Bild zum Endpunkt wird, kann H3 stattdessen zwischen den Bildern morphen, anstatt die gewünschte Aktion auszuführen. Wenn jedes Bild lediglich als lockere Referenz dient, erreicht der Clip möglicherweise nie die geplante Pose.

Erster/letzter Frame im Vergleich zu Zwischenanweisungen

Der Standardweg mit erstem und letztem Frame definiert zwei Grenzen. Mit MiniMaxH3AddGuide von ComfyUI lässt sich ein Bild, ein kurzer Clip, ein Audio-Hinweis oder ein audiovisueller Leitfaden an einem gewählten frame_idx platzieren; mehrere Leitknoten können verkettet werden, um mehrere Ankerpunkte zu realisieren. Damit wird eine echte dreistufige oder vierstufige Bewegung innerhalb eines generierten Clips möglich.

Verwenden Sie Zwischenanweisungen ausschließlich für nicht verhandelbare Schlüsselmomente. Eine sich ausstreckende Hand benötigt möglicherweise keinen eigenen Frame, doch ein Produkt, das eine Position verlässt und unversehrt an einer anderen ankommt, könnte dies durchaus tun.

Vier fertige Produkt-Keyframes, die dieselbe bernsteinfarbene Parfümflasche zeigen, die sich von einer teilweisen Enthüllung zu einer sauberen Hero-Komposition bewegt

Ein Test mit vier Ankerpunkten soll Geometrie der Flasche, Glasfarbe, Verschluss, Steinbesatz, Leinen und Tageslicht bewahren, während sich die Bildkomposition schrittweise zur endgültigen Enthüllung hin entwickelt.

Erstellen Sie vor der Generierung einen Keyframe-Plan

Das beste Ergebnis beginnt als kurze Zeitachse. Formulieren Sie die Aktion in Wiedergabereihenfolge und markieren Sie, welche Zustände exakt sein müssen; lassen Sie den Raum zwischen den Ankern für natürliche Bewegung frei.

Wandeln Sie eine Idee in zeitlich gesteuerte Story-Beats um

Für einen achtsekündigen Shot könnte ein sinnvoller Plan lauten: Frame 0 stellt das Motiv vor, ein früher Leitframe startet die Aktion, ein später Leitframe bestätigt die Hauptveränderung und der letzte Frame führt zum Abschluss. Bei 24 fps entspricht Frame 96 etwa vier Sekunden – berechnen Sie jedoch stets anhand der tatsächlichen Frame-Anzahl, die vom Graphen verwendet wird.

Zeitachsen-Rolle Was das Bild festlegen soll Was die Prompt-Beschreibung enthalten soll
Öffnungsanker Identität, Komposition, Startpose Erste Bewegung und Kameraverhalten
Mittlerer Leitframe Kritischer Aktionszustand oder Objektposition Wie das Motiv diesen Zustand erreicht und verlässt
Später Leitframe Ergebnis, Enthüllung oder veränderte Beziehung Verlangsamung und visuelle Kontinuität
Endanker Stabile Endkomposition Letzte Bewegung, Ton und Haltephase

Gestalten Sie kompatible Keyframe-Bilder

Passen Sie Seitenverhältnis, Objektgröße, Kamerahöhe, Objektiv, Bildrichtung und Lichtquelle an. Eine Weitwinkelaufnahme am Anfang und eine extreme Nahaufnahme in der Mitte könnten eine unplausible Kamerabewegung erfordern. Größere Änderungen sollten erst nach erfolgreicher Überprüfung von Identität und Timing eingeführt werden.

Vier fertige Keyframes desselben Uhrmachers und des Messing-Automaten-Vogels, wobei Identität, Werkzeuge, Materialien und Studio-Licht erhalten bleiben

Tatsächliche Keyframes im Output-Stil sollten als eine einzige Performance lesbar sein. Hier bleiben Uhrmacher, Schürze, Werkbank, Werkzeuge, Messingmaterial und Fensterlicht stabil, während sich der Vogel verändert.

Geben Sie jeder Referenz eine einzige Aufgabe

Benennen Sie jedes Asset nach seiner Funktion: Identität, Kleidung, Umgebung, Produkt, Bewegung, erster Frame, mittlerer Leitframe oder letzter Frame. Fordern Sie nicht von einem einzigen widersprüchlichen Bild zugleich die Definition eines anderen Darstellers und desselben Darstellers. Für lockerere visuelle Orientierung statt exakter Zeitpunkte auf der Zeitachse nutzen Sie den Referenz-zu-Video-Workflow.

MiniMax H3 Multi-Keyframe-Workflow: Schritt für Schritt

1. Erstellen Sie die audiovisuelle Latente

Wählen Sie das Ausgabeverhältnis, die Auflösung, die Dauer und die endgültige Frame-Anzahl, bevor Sie Leitframes hinzufügen. Der Image-VAE muss mit dem H3-Graphen kompatibel sein, und jeder gewählte Frame-Index muss innerhalb der Latent-Zeitachse liegen. Eine Änderung der Dauer nach Platzierung der Leitframes kann die beabsichtigten Beats verschieben oder ungültig machen.

2. Öffnungsanker hinzufügen

Beginnen Sie mit einem sauberen Bild, das das Motiv und die Umgebung deutlich zeigt. Vermeiden Sie Bewegungsunschärfe, verdeckte Hände, zugeschnittene Produkte, unleserliche Silhouetten oder eine Pose, die bereits instabil wirkt. Der Öffnungsrahmen legt die Geometrie fest, der sich spätere Ankerfolgen müssen.

3. Zwischenanleitungs-Knoten verkettet hinzufügen

Leiten Sie die positive Bedingung von einem MiniMaxH3AddGuide-Knoten zum nächsten weiter. Fügen Sie ein genehmigtes Bild an und legen Sie dessen frame_idx fest. Halten Sie den Graphen chronologisch, damit spätere Diagnosen lesbar bleiben.

4. Endzustand hinzufügen

Verwenden Sie die native Eingabe für den letzten Rahmen, wenn die endgültige Komposition exakt sein muss. Gestalten Sie diesen als glaubwürdiges Ziel und lassen Sie einen kurzen „Settling Beat“ für den Produkt-Rahmen, die vollendete Geste oder den sauberen Schnitt.

5. Schreiben Sie die Brücke – nicht vier separate Prompts

Die Bilder beschreiben bereits das Erscheinungsbild. Der Prompt soll stattdessen die Bewegung dazwischen beschreiben:

Beginnen Sie mit dem genehmigten ersten Rahmen. Die Handwerkerin hebt dieselbe kobaltblaue Vase mit beiden Händen an, geht ruhig von links nach rechts und stellt sie auf das festgelegte Holzregal. Bewahren Sie Gesicht, olivfarbenes Hemd, tonverschmierte Schürze, Proportionen der Vase, Studio-Layout und Tageslicht bei. Verwenden Sie eine kontinuierliche laterale Kamerabewegung mit natürlichen Schritten, Stoffbewegung und keramischem Kontakt. Lösen Sie in den vorgegebenen Endrahmen auf und halten Sie ihn.

Drei fertige Schlüsselframes derselben Töpferin, die eine kobaltblaue Vase durch ein konsistentes Studio trägt

Ein praktischer Dreischlüsselframe-Test: Die Aktion ändert sich, doch Darstellerin, kobaltblaue Vase, Schürze, Regale, Fenster und die Links-rechts-Richtung bleiben erkennbar.

Konsistenz von Figur, Umgebung, Kamera und Audio bewahren

Identität separat von der Pose fixieren

Verwenden Sie für jeden Versuch denselben kanonischen Gesichts-Referenzrahmen. Erlauben Sie Schlüsselframes, Pose, Mimik oder Distanz zu ändern, ohne Alter, Gesichtsstruktur, Haare und Kleidung neu zu definieren. Vergleichen Sie das Gesicht im Öffnungsrahmen, im Weitwinkelrahmen und im Endrahmen.

Umgebungsgeometrie bewahren

Listen Sie stabile räumliche Beziehungen auf – nicht nur eine Sammlung von Substantiven: Fenster hinter der Bank, blauer Schrank rechts vom Kamerastandort, Lampe über dem Tisch. Die MiniMax H3 Umgebungs-Konsistenz-Anleitung zeigt, wie man Ortsanker von Figuren- und Bewegungsreferenzen trennt.

MiniMax H3 · fertiges Beispiel für Umgebungs-Kontinuität

Bewerten Sie bewegtes Filmmaterial – nicht nur Standbilder. Das Gewächshaus, der Tisch, die Stühle, die Pflanzen, die Lampen, der Krug, der Kleiderschrank und das Tageslicht sollten während der Aktion weiterhin erkennbar bleiben.

Kamera- und Audio-Logik bewahren

Halten Sie das Motiv in einer Bildschirmrichtung in Bewegung, es sei denn, der Prompt fordert ausdrücklich eine motivierte Richtungsänderung. Vermeiden Sie Anfragen nach Orbit, Zoom, Kran- oder Objektivwechsel zwischen eng beieinanderliegenden Ankerpunkten. Wenn die Synchronisation von Ton wichtig ist, platzieren Sie einen kurzen Audiosignal an derselben Bildnummer wie das visuelle Ereignis und prüfen Sie anschließend das gesamte Clip auf Dialog-Wiederholungen, wiederholte Aufpralleffekte oder abrupte Änderungen des Raumtons.

Drei fertige Kamera-Schlüsselframes desselben Cellisten, der in einem Proberaum spielt

Weitwinkel-, Nahaufnahme- und Mittelplan können dennoch kontinuierlich wirken, solange Darsteller, Cello, Stuhl, Raum, Fensterlicht und Bogenrichtung stabil bleiben.

MiniMax H3 · fertige Performance mit synchronisiertem nativem Audio

Verwenden Sie das bewegte Ergebnis, um Rhythmus der Hände, Kamera-Kontinuität, Instrumentendetails und die Übereinstimmung von Audio und sichtbarer Performance zu beurteilen.

ComfyUI Multi-Schlüsselframe-Steuerung vs. Seedance Agent

Wählen Sie ComfyUI für Steuerung auf Rahmenebene

Lokales ComfyUI eignet sich für Ersteller, die exakte Bildnummern, wiederverwendbare Graphen, Zugriff auf latente Repräsentationen oder Experimente mit Bild- und Audio-Ankern benötigen. Der Preis dafür ist die Verwaltung von Modellen, VRAM, Knotenversionen, Pfaden, Metadaten und Fehlern.

Wählen Sie Seedance Agent für Produktionsmanagement

Seedance Agent beginnt beim Produktionsziel. Geben Sie ihm das Briefing, Referenzen, erforderliche Beats, Seitenverhältnis und Akzeptanzkriterien; nutzen Sie es zur Planungsorganisation, zum Vergleich der Ergebnisse, zur Freigabe einzelner Abschnitte und zum erneuten Ausführen nur der fehlgeschlagenen Teile. Die wiederaufnehmbare Multishot-Arbeitsweise erklärt, wie freigegebene Shots zu dauerhaften Kontrollpunkten werden.

Nutzen Sie bei schwierigen Shots eine hybride Vorgehensweise

Planen Sie die Sequenz und die Rollen der Referenzen in Seedance Agent, leiten Sie den einen zeitkritischen Shot an einen lokalen H3-Graphen weiter und geben Sie das Ergebnis anschließend zur Überprüfung und Zusammenstellung zurück. Das kreative Briefing bleibt für das Team lesbar, während der schwierige Abschnitt seine Steuerung auf Rahmenebene behält. Beginnen Sie mit Seedance Agent, wenn die Koordination der Produktion wichtiger ist als die Pflege der Knoten.

Korrektur von Frame-Drift, harten Morphs und verpassten Schlüsselframes

Ein mittlerer Schlüsselframe wird ignoriert

Stellen Sie sicher, dass der Anker mit der finalen positiven Bedingung verbunden ist, dass die VAE-Eingabe vorhanden ist und dass frame_idx innerhalb des Videos liegt. Verschieben Sie den Anker dann weiter von benachbarten Ankern weg. Zwei inkompatible Ziele, die zu nahe beieinander liegen, lassen dem Modell zu wenig Zeit, die Übergangsphase korrekt auszuführen.

Der Übergang wirkt wie ein Ausblenden

Verringern Sie den visuellen Sprung. Halten Sie Identität, Hintergrund, Objektiv und Beleuchtung stabil und ändern Sie ausschließlich Pose oder Objektposition. Ersetzen Sie vage Formulierungen wie „verwandelt sich fließend“ durch einen sichtbaren physikalischen Pfad: öffnet sich, dreht sich, schreitet, entfaltet sich, gießt sich oder platziert sich.

Das Gesicht verändert sich in einer Weitwinkelaufnahme

Verwenden Sie das kanonische Identitätsbild erneut, vereinfachen Sie den mittleren Schlüsselframe und prüfen Sie, ob das Gesicht groß genug ist, um nützliche Details zu zeigen. Verbessern Sie eine ansonsten genehmigte Aufnahme aus der Ferne mithilfe des H3-Ferngesichts-Workflows, statt eine stabile Sequenz zu verwerfen.

Der Graph wird zu teuer

Belegen Sie Timing und Kontinuität zunächst in einer niedrigeren Entwurfsauflösung. Verfeinern oder skalieren Sie erst dann ein genehmigtes Ergebnis hoch. Verfolgen Sie die Kosten pro genehmigtem Clip – nicht pro Generierung – und ändern Sie bei jedem Neustart nur eine Variable, sodass das nächste Ergebnis Ihnen etwas Neues lehrt.

Fazit

Ein zuverlässiger MiniMax H3-Multi-Schlüsselframe-Workflow überzeugt nicht durch die größtmögliche Anzahl an Bildern. Stattdessen nutzt er eine kleine Menge kompatibler Ankerpunkte, weist jeder Referenz genau eine Rolle zu, beschreibt die physikalische Bewegung zwischen den Zuständen und prüft das vollständige audiovisuelle Ergebnis. Verwenden Sie ComfyUI, wenn die exakte Platzierung einzelner Frames kreativ erforderlich ist; verwenden Sie Seedance Agent, wenn die größere Aufgabe in Planung, Genehmigung, Kontinuität und gezielten Neuberechnungen besteht. Beginnen Sie mit einem Test mit drei Schlüsselframes, genehmigen Sie die Bewegung vor der Verfeinerung und erweitern Sie dann die Sequenz, ohne auf bereits bestandene Arbeit zu verzichten.

Bereit, es selbst auszuprobieren?

Setzen Sie die Schritte aus diesem Leitfaden direkt in Seedance um und verwandeln Sie Prompts oder Bilder in wenigen Minuten in fertige Videos.

Kostenlose Credits bei der Anmeldung. Tarife ab $20/Monat.