MiniMax H3 ComfyUI: Vollständige Einrichtungsanleitung für T2V-, I2V- und R2V-Workflows

E
Emma Chen·8 Min. Lesezeit·Aug 17, 2026
Auf X teilen
MiniMax H3 ComfyUI: Vollständige Einrichtungsanleitung für T2V-, I2V- und R2V-Workflows

KI-Überblick

Können Sie MiniMax H3 lokal in ComfyUI ausführen?

Ja. MiniMax H3 verfügt über offene Gewichte und native Unterstützung in ComfyUI 0.30.0 oder neuer. Laden Sie eine H3-Vorlage, laden Sie das erforderliche Diffusionsmodell, den Textencoder sowie zwei VAEs herunter und führen Sie es auf Ihrer eigenen Hardware aus.

Welche Workflows unterstützt MiniMax H3 in ComfyUI?

ComfyUI enthält H3-Vorlagen für Text-zu-Video, Bild-zu-Video mit optionalen ersten/letzten Frames sowie Referenz-zu-Video. Alle drei können nativ Stereo-Dialoge, Soundeffekte und Musik zusammen mit dem Video generieren.

Wie viel VRAM benötigen Sie, um MiniMax H3 in ComfyUI auszuführen?

Es gibt keine einzige feste Mindestanforderung. Eine 24-GB-GPU ist ein realistisches Ziel für den optimierten int8-Workflow; reduzierte Community-Tests mit 480p haben auf 12-GB-GPUs mit 32-GB-Systemspeicher, Offloading und schnellem Speicher funktioniert.

Bereit, es selbst auszuprobieren?

Kostenlose Credits bei der Anmeldung. Tarife ab $20/Monat.

Seedance kostenlos testen

Gibt es eine einfachere Alternative zum lokalen Betrieb von MiniMax H3 in ComfyUI?

Ja. Seedance bietet browserbasierte Audio-Video-Generierung ohne lokale Modell-Downloads, Knotenkonfiguration oder GPU-Speicherplanung – einfacher, wenn Sie einen fertigen Clip und nicht einen benutzerdefinierten lokalen Graphen benötigen.

Was ist MiniMax H3 und warum führen Sie es in ComfyUI aus?

MiniMax H3 ist ein Open-Weights-Modell mit omnimodaler Generierungsfähigkeit, das Text, Bilder, Video und Audio in einem gemeinsamen Kontext versteht. Es kann Video mit bis zu 2K-Auflösung, 24 fps und einer Dauer von ca. 15 Sekunden erzeugen, wobei Stimme, Soundeffekte und Musik als natives Stereo-Audio gemeinsam generiert werden.

ComfyUI verwandelt diese Fähigkeiten in einen übersichtlichen Knotengraphen. Sie können die Modellpräzision, den Seed, die Auflösung, die Dauer, den Scheduler, Referenzen, den ersten oder letzten Frame sowie den Ausgabepfad wählen – und speichern den Graphen anschließend als wiederholbaren Produktionsworkflow. Native Vorlagen decken T2V, I2V und R2V ab, während die zentralen H3-Knoten für spezialisiertere Graphen neu kombiniert werden können.

Führen Sie H3 lokal aus, wenn Parameterkontrolle, wiederverwendbare Knoten, private Eingaben oder Batch-Automatisierung wichtiger sind als die Einrichtungszeit. Es eignet sich für Creator, die ComfyUI bereits beherrschen, sowie für Teams, die pro-Aufruf geltende API-Quoten vermeiden möchten. Der Nachteil besteht in erheblichem Speicherbedarf, aufwändiger GPU-Speicherplanung, langen Downloadzeiten und mehr Fehlersuche als bei einem Browser-Workflow.

Systemvoraussetzungen und Modell-Downloads

Aktualisieren Sie ComfyUI auf 0.30.0 oder neuer, öffnen Sie dann Workflow → Workflow-Vorlagen durchsuchen → Video und wählen Sie eine MiniMax-H3-Vorlage aus. ComfyUI kann nach fehlenden Dateien fragen, doch manuelle Platzierung erleichtert die Diagnose von Problemen.

Erforderliche Datei Platzieren Sie sie in Zweck
minimax_h3_fl2va_pruned_int8_convrot.safetensors ComfyUI/models/diffusion_models/ T2V, I2V sowie Generierung des ersten/letzten Frames
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors ComfyUI/models/text_encoders/ Multimodales Prompt- und Referenzverständnis
minimax_h3_video_vae_fp16.safetensors ComfyUI/models/vae/ Kodierung und Dekodierung von Videolatenzraum
minimax_h3_audio_vae_fp32.safetensors ComfyUI/models/vae/ Native Audio-Kodierung und -Dekodierung

R2V verwendet stattdessen minimax_h3_ref2va_pruned_int8_convrot.safetensors im Ordner diffusion_models/, nicht die FL2VA-Diffusionsdatei. Behalten Sie die vollständigen Dateinamen bei; nach dem Hinzufügen aktualisieren Sie die Modelle oder starten Sie ComfyUI neu.

Behandeln Sie 24 GB VRAM als komfortables Planungsziel für den optimierten int8-Workflow – nicht als veröffentlichte Mindestanforderung. Grafikkarten mit geringerem Speicher benötigen kleinere Frames, kürzere Clips, aggressives Offloading sowie ausreichend Systemspeicher und NVMe-Speicherplatz für das Modell-Swapping. Falls der Graph nicht geladen werden kann oder die meiste Zeit mit Swapping verbringt, reduzieren Sie zunächst die Auflösung oder verschieben Sie den Workflow auf Cloud-Hardware.

Einrichtung des MiniMax H3 Text-zu-Video-(T2V)-Workflows

  1. Öffnen Sie die Vorlagenbibliothek und laden Sie MiniMax H3 T2V.
  2. Stellen Sie sicher, dass das Diffusionsmodell, der Qwen3-VL-Textencoder, der Video-VAE und der Audio-VAE ausgewählt sind.
  3. Wählen Sie im Auflösungs-Selector das Seitenverhältnis und die Megapixelanzahl; halten Sie multiple bei 32.
  4. Geben Sie einen strukturierten Prompt ein, legen Sie Dauer und Seed fest und reihen Sie den Graphen in die Warteschlange ein.
  5. Überprüfen Sie Bild, Dialog, Effekte, Musik und den letzten Frame, bevor Sie die Auflösung erhöhen.

Die native Arbeitsfläche von H3 nutzt eine kurze Kante von 768 px und begrenzt eine Seite auf ca. 1344 px. Bei einem Seitenverhältnis von 16:9 und ca. 1,0 Megapixel ergibt sich etwa 1344×768. Beginnen Sie mit kleineren Auflösungen für Prompt-Tests und skalieren Sie nur die genehmigte Konfiguration hoch. Die Dauer wird an das Frame-Block-Raster von H3 bei 24 fps angepasst, sodass ComfyUI den gewünschten Wert ggf. leicht korrigiert.

Beschreiben Sie zunächst die Szene, dann die zeitlich abgestimmte Aktion, die Kamerabewegung und schließlich den Ton – alles im selben Prompt-Block. Ein klarer T2V-Entwurf ist zuverlässiger als eine Liste unzusammenhängender filmischer Adjektive. Für einen schnelleren gehosteten Einstieg entfernt der Seedance Text-to-Video-Workflow die lokalen Graph- und Download-Schritte.

MiniMax H3 T2V · offizielle ComfyUI-Vorlagenausgabe

Offizielle ComfyUI-Vorlagenausgabe für MiniMax H3 T2V. Es handelt sich um ein echtes Workflow-Beispiel, das auf Seedance R2 für zuverlässige Wiedergabe neu gehostet wurde.

Einrichtung des MiniMax H3 Bild-zu-Video-(I2V)-Workflows

Die I2V-Vorlage nutzt MiniMaxH3ImageToVideo. Verbinden Sie ein Bild mit first_frame, optional ein weiteres mit last_frame, und beschreiben Sie die Bewegung zwischen beiden. Beide Eingaben sind auf Knotenebene optional, sodass dieselben FL2VA-Gewichte für textgeführte, erste-Frame-, letzte-Frame- oder erste-und-letzte-Frame-Workflows genutzt werden können.

I2V eignet sich am besten für Produktvorstellungen, Charakterkontinuität, kontrollierte Übergänge und stilorientierte Animation. Passen Sie die Ausgabe an die 768-px-kurze-Kante-Canvas von H3 an, halten Sie die Abmessungen durch 32 teilbar und vermeiden Sie stark komprimierte oder sehr kleine Quellen. Beschreiben Sie zunächst, was unverändert bleiben muss, bevor Sie die Kamerabewegung angeben.

Offizielle transparente Gaming-Maus-Eingabe, die von der MiniMax-H3-I2V-Vorlage verwendet wird

Das echte Eingabebild, das zusammen mit der MiniMax-H3-I2V-Vorlage für ComfyUI ausgeliefert wird.

MiniMax H3 I2V · offizielle ComfyUI-Vorlagenausgabe

Das offizielle I2V-Ergebnis auf Grundlage dieses Quellbilds. Vergleichen Sie Form, Materialien, Radpositionierung, Kamerapfad und Ton – nicht nur den visuellen Eindruck des ersten Frames.

Falls Sie dieselbe Idee „Eingabe zu Bewegung“ ohne lokale Gewichtsdateien nutzen möchten, probieren Sie Seedance Image to Video aus.

Einrichtung des MiniMax-H3-Referenz-zu-Video-(R2V)-Workflows

R2V nutzt MiniMaxH3ReferenceToVideo sowie die separaten ref2va-Diffusionsgewichte. Es akzeptiert gemischte Bilder, Videos und Audio, sodass ein Zielszenen-Shot Identität, visuellen Stil, Subjektbewegung, Kamerabewegung oder Stimme aus unterschiedlichen Quellen übernehmen kann.

Verbinden Sie Referenzen in einer gezielten Reihenfolge und benennen Sie sie im Prompt exakt so: <Picture 1>, <Video 1> und <Audio 1>. Weisen Sie jeder Referenz eine einzige Aufgabe zu. Beispiel: Bewahren Sie die Figur aus <Picture 1>; nutzen Sie die Dolly-Bewegung aus <Video 1>; passen Sie den Tonfall der Stimme aus <Audio 1> an. Der aktuelle ComfyUI-Workflow unterstützt bis zu neun Bilder, drei Videos und drei eigenständige Audio-Clips.

Verwenden Sie ref_image_size=match für schnellere Tests oder max, um bei hoher Identitätsrelevanz (und geringerer Geschwindigkeitspriorisierung) eine kurze Referenzkante bis maximal 2048 px beizubehalten. Zu viele sich überlappende Referenzen können die Befolgung von Anweisungen schwächen – daher sollten Sie zunächst einen Zwei-Referenz-Graphen validieren, bevor Sie weitere hinzufügen.

MiniMax H3 R2V · offizielle ComfyUI-Vorlagenausgabe

Offizielle R2V-Vorlagenausgabe unter Verwendung der ausgelieferten Charakter- und Stilreferenzen.

Für einen gehosteten Referenz-Workflow öffnen Sie Seedance Reference to Video. Die MiniMax-H3-Referenz-Video-Anleitung enthält eine detailliertere Anleitung zum Schreiben von Prompts und zur Zuweisung von Referenzen.

Tipps zum Schreiben effektiver Prompts für bessere MiniMax-H3-Ausgaben

Verwenden Sie für H3-Prompts drei explizite Felder: integrated_multimodal_description, overall_soundscape und non_diegetic_music. Beschreiben Sie innerhalb der Szenenbeschreibung zeitlich gesteuerte Shots, sichtbare Aktionen, Kameraanweisungen und exaktes Dialogmaterial. Geben Sie wiederkehrenden Sprechern stabile IDs wie (S1) und platzieren Sie ausschließlich gesprochene Wörter innerhalb von <d>[Englisch] ...</d>.

T2VA — schwach: Eine filmische Stadt-Szene mit coolen Sounds.

T2VA — besser: 0–3 s: Weitwinkel-Aufnahme einer regennassen Fußgängerampel, langsame Dolly-Bewegung nach vorne; 3–7 s: Kurier dreht sich zur Kamera hin. Fußschritte und Straßenverkehr im Stereo; tiefe Perkussion beginnt bei 4 s.

I2VA/FL2VA — schwach: Animiere dieses Bild dramatisch.

I2VA/FL2VA — besser: Bewahre die Produktgeometrie, das Rad, die Tasten, die transparente Gehäusestruktur sowie die blau-orange Beleuchtung. Eine langsame 30-Grad-Orbit-Bewegung; keine neuen Textelemente oder Komponenten. Ende genau auf den bereitgestellten letzten Frame abgestimmt.

R2V — schwach: Nutze alle Referenzen und erzeuge ein Action-Video.

R2V — besser: Behalte Identität und Kostüm aus <Picture 1>bei; übernehme ausschließlich die Kamerabewegung aus<Video 1>; passe den Stimmton aus <Audio 1> an. Übertrage weder das Videomotiv noch den Hintergrund.

T2VA benötigt eine vollständige Weltbeschreibung. I2VA sollte die Quelle vor dem Hinzufügen von Bewegung schützen. FL2VA und L2VA müssen den Übergang in den bereitgestellten Begrenzungsframe beschreiben. R2V muss die Beziehung zwischen jeder Referenz und dem Zielobjekt erklären. Die MiniMax-H3-Prompt-Anleitung vertieft diese modusspezifischen Muster.

MiniMax H3 in ComfyUI im Vergleich zu browserbasierten KI-Video-Tools

Faktor Lokales H3 in ComfyUI Seedance Comfy Cloud
Einrichtung Installieren/Aktualisieren von ComfyUI und Platzieren großer Gewichtsdateien Öffnen im Browser Laden einer gehosteten ComfyUI-Vorlage
Lokaler VRAM Erforderlich; Einstellungen hängen von Präzision und Ausgabe ab Nicht erforderlich Nicht lokal erforderlich
Workflow-Kontrolle Vollständige Steuerung auf Knotenebene sowie Automatisierung Optimiertes Generierungsinterface ComfyUI-Graph ohne lokale Hardware
Native Audio H3-Stereo-Audio in derselben Generierung Gemeinsamer Audio-Video-Workflow Derselbe H3-Workflow auf Cloud-Infrastruktur
Ideal für Tiefe Anpassung, lokale Eingaben, wiederverwendbare Graphen Schnelle Ideenfindung und Produktion ohne Einrichtungsaufwand ComfyUI-Nutzer ohne lokale GPU-Leistungsfähigkeit

Wählen Sie lokales ComfyUI, wenn der Graph selbst Teil Ihres Produktionssystems ist. Wählen Sie gehostetes ComfyUI in der Cloud, wenn Sie dessen Knoten nutzen möchten, aber nicht die Hardware-Last tragen wollen. Wählen Sie Seedance, wenn Sie direkt vom Prompt oder einer Referenz zu einem verwendbaren Clip gelangen möchten – mit möglichst wenigen Infrastruktur-Entscheidungen. Probieren Sie Seedance direkt in Ihrem Browser aus →

Fazit

MiniMax H3 ist eine der leistungsfähigsten Open-Weights-Optionen für ComfyUI, um Video und natives Audio gemeinsam zu generieren. Beginnen Sie in drei Schritten: Aktualisieren Sie auf ComfyUI 0.30.0+, platzieren Sie das Diffusionsmodell, den Textencoder und die beiden VAEs in den jeweils korrekten Ordnern und laden Sie anschließend die passende T2V-, I2V- oder R2V-Vorlage. Halten Sie erste Tests klein, weisen Sie jeder Referenz eine klare Aufgabe zu und erhöhen Sie die Auflösung erst, nachdem der Prompt funktioniert; falls lokale Downloads, VRAM-Anforderungen und Knotenwartung den Nutzen einer tiefen Kontrolle übersteigen, ist ein browserbasierter Seedance-Workflow der schnellere Weg in die Produktion.

Bereit, es selbst auszuprobieren?

Setzen Sie die Schritte aus diesem Leitfaden direkt in Seedance um und verwandeln Sie Prompts oder Bilder in wenigen Minuten in fertige Videos.

Kostenlose Credits bei der Anmeldung. Tarife ab $20/Monat.