- Blog
- Seedance 2.5 Mehrpersonen-Dialog: So generieren Sie konsistente Zwei-Personen-Szenen
Seedance 2.5 Mehrpersonen-Dialog: So generieren Sie konsistente Zwei-Personen-Szenen

Übersicht über die KI-Funktionen
Kann Seedance 2.5 Videos mit mehreren Charakteren generieren, die miteinander sprechen?
Ja. Weisen Sie jeder Person ein dediziertes Referenzbild und eine eindeutige Rollenbezeichnung zu, und geben Sie für jeden zeitlich abgegrenzten „Beat“ an, wer spricht, wer zuhört und wo sich beide Personen jeweils befinden.
Wie halte ich zwei Charaktere visuell konsistent in einer Seedance-2.5-Dialogszene?
Verwenden Sie pro Charakter jeweils ein sauberes Einzelpersonen-Referenzbild, wiederholen Sie dieselbe Ankerphrase wortwörtlich, und halten Sie Garderobe, Beleuchtung, Bildrichtung („screen direction“) sowie gemeinsame Requisiten während der gesamten Szene konstant.
Wie viele Charaktere kann Seedance 2.5 in einer einzigen Generierung verarbeiten?
Zwei Charaktere sind die am besten kontrollierbare Konfiguration; drei Charaktere sind möglich, sofern die Referenzen deutlich voneinander abweichen. Für größere Gruppen empfiehlt es sich, fokussierte Paar- oder Reaktionsshots separat zu generieren und anschließend zu montieren.
Welche Prompt-Struktur eignet sich am besten für eine KI-generierte Dialogszene in Seedance 2.5?
Planen Sie zunächst einen weiten Zwei-Personen-Schuss, dann je einen Mittelschuss pro Sprecher und abschließend eine Reaktions- oder Auflösungsszene. Benennen Sie in jedem Beat stets den aktiven Sprecher, die Aktion, die Kameraeinstellung und die Position des Zuhörers.
Warum Mehrpersonen-Dialoge die schwierigste Aufgabe im KI-Video sind
Ein Einzelcharakter-Clip fordert vom Modell lediglich, ein Gesicht, ein Outfit, ein bestimmtes Körperausdrucksmuster und eine festgelegte Bewegungsroute durch die Szene beizubehalten. Ein Dialogschuss hingegen erfordert all dies zweimal – zusätzlich müssen Blicklinien, Sprechwechsel, Handbewegungen, Kamera-Schnitte und Tonverlauf korrekt verfolgt werden. Sobald ein Prompt lediglich „zwei Personen unterhalten sich“ enthält, muss das Modell erraten, wem ein Dialogtext zuzuordnen ist, wohin der Zuhörer blickt und welche visuellen Details jeweils zu welcher Person gehören.

Zwei klare Charakteridentitäten, ein gemeinsamer Raum und eine eindeutige Position des Zuhörers bilden die Grundlage für einen kontrollierbaren Dialogschuss.
Diese Unklarheit kann zu sogenannten „Identity Leaks“ führen: Nach einem Schnitt übernimmt ein Charakter z. B. die Haarfarbe, Jackenfarbe, Haltung oder Gesichtszüge des anderen. Ebenso kann es zu „Role Leaks“ kommen, bei denen visuell Charakter A spricht, während der Prompt jedoch die Aktion von Charakter B beschreibt. Die praktikable Lösung besteht nicht in noch mehr Adjektiven, sondern in einer wiederholbaren Produktionsvorlage: je ein Referenzbild pro Person, eine Rollenbezeichnung für jedes Referenzbild und ein „Beat Sheet“, das jedem Moment einen eindeutigen Verantwortlichen zuweist.
Seedance 2.5 ist hier besonders nützlich, wenn Sie einen Dialog als zusammenhängende Einzelaufnahmen statt als einzelnen Textabsatz behandeln. Erstellen Sie zunächst eine zuverlässige Ausgangsszene in reference to video, und verwenden Sie dieselben Ankerphrasen für alle Varianten. Falls die beiden Charaktere eine vorab genehmigte Einstiegs-Komposition benötigen, beginnen Sie mit image to video und animieren Sie diesen Frame direkt – anstatt den Raum von Grund auf textuell zu beschreiben.
Einrichten der Charakterreferenzen in Seedance 2.5
Erstellen Sie je ein Referenzbild pro Charakter, nicht ein einziges Bild mit beiden Personen. Das ideale Referenzbild zeigt eine scharfe Einzelpersonansicht mit gut erkennbarem Gesicht, Frisur, Silhouette und Outfit. Es muss kein Studioportrait sein, sollte aber alle visuellen Merkmale enthalten, die Sie sich über die gesamte Szene hinweg erhalten möchten.
Für eine Zwei-Personen-Szene sollten die Unterschiede bewusst gestaltet sein. Wenn beide Personen dunkles Haar, dunkle Mäntel und ähnliche Körpergröße haben, bietet das Modell weniger Anhaltspunkte zur Unterscheidung. Wählen Sie stattdessen klare visuelle Anker: z. B. einen rostrot gefärbten Regenmantel und einen stumpfen Bob für Charakter A sowie eine marineblaue Feldjacke und kurzes lockiges Haar für Charakter B. Halten Sie diese Unterscheidungen sachlich und nicht dekorativ.
Vermeiden Sie Paarfotos, überfüllte Gruppenaufnahmen oder Referenzen mit inkonsistenter Beleuchtung und stark detailreichen Hintergründen. Solche Bilder erschweren die Zuordnung einer Identität zu einer Rolle. Beschriften Sie die hochgeladenen Referenzen und verwenden Sie dieselben Bezeichnungen auch im Prompt:
Character A: woman with a blunt dark bob, rust-red raincoat, cream sweater, canvas shoulder bag.
Character B: man with short curly black hair, navy field jacket, grey T-shirt.
Die Bezeichnung dient ausschließlich der Produktion – sie ist kein Teil des Dialogs. Ändern Sie sie nicht in „die Frau“, „sie“, „die Person mit dem roten Mantel“ oder ein kürzeres Synonym im nächsten Beat. Eine konsistente Sprachwahl gibt dem Modell bei jedem Schritt dieselbe Identitätsanweisung.
Die Prompt-Struktur für Dialogszenen – Beat für Beat
Der sicherste Zwei-Personen-Dialog erfüllt vier visuelle Aufgaben: Beat 1 etabliert die Beziehung; Beats 2 und 3 machen den Sprechwechsel eindeutig; Beat 4 verleiht der Szene einen nachvollziehbaren Abschluss. Diese Struktur funktioniert sowohl für 15-Sekunden-Austausche als auch für längere Szenen, die in montagefreundliche Clips unterteilt sind.
| Beat | Aufgabe | Prompt-Verantwortung |
|---|---|---|
| 1 | Weiter Einstiegs-Schuss („wide establishing shot“) | Platzieren Sie beide Charaktere am selben Ort und fixieren Sie die Bildrichtung („screen direction“). |
| 2 | Charakter A spricht | Nennen Sie A’s Aktion, die Kameraeinstellung und B’s Zuhörposition. |
| 3 | Charakter B antwortet | Tauschen Sie die Rollen: B agiert, A bleibt an der bereits festgelegten Position im Vordergrund und hört zu. |
| 4 | Reaktion oder Auflösung | Enden Sie mit einem stummen Blick, einer Entscheidung, einer gemeinsamen Aktion oder einer stabilen Haltepose. |

Ein Kontaktblatt macht Kontinuitätsprobleme sichtbar, bevor ein Dialog zu einem langen Prompt wird.
Hier ist das praktisch anwendbare Muster:
[0–4s] Wide two-shot at a daylight train-station café. Character A sits screen left facing right;
Character B sits screen right facing left. Both remain seated at the same wooden table.
[4–8s] Medium shot on Character A. Character A quietly says one short line and touches the cup;
Character B remains in the right foreground, listening without speaking. Slow, stable push-in.
[8–12s] Medium shot on Character B. Character B answers with one short line;
Character A remains in the left foreground, listening. Same daylight and camera height.
[12–15s] Return to a close two-shot. Both characters pause, exchange a brief look, and hold for 1.5 seconds.
```Die Details, die in jedem Bildausschnitt zählen, sind: **aktiver Sprecher, dominierende Aktion, Kameraperspektive, Position des Zuhörers und Kontinuitätsanker**. Falls Sie Unterstützung bei der Zuweisung dieser Bereiche benötigen, zeigt die [Seedance-2.5-Zeitstrahl-Anleitung für Prompt-Generierung](/blog/seedance-2-5-timeline-video-prompt), wie Sie jeder Zeitintervall genau eine Aufgabe zuweisen.
## So verfassen Sie prägnante Charakterankerphrasen, die haften bleiben
Eine Ankerphrase ist die kürzeste wiederholbare Beschreibung, die einen Charakter unverwechselbar macht. Sie ist keine neue literarische Beschreibung für jede Einstellung. Kopieren Sie sie exakt in jeden Bildausschnitt und ergänzen Sie lediglich die jeweilige Aktion sowie die Kameraveränderung.
Für einen natürlichen Café-Austausch verwenden Sie:
```text
Charakter A: Frau mit kurzem dunklem Bob, rostrotem Regenmantel, cremefarbenem Pullover und Canvas-Schultertasche.
Charakter B: Mann mit kurzem lockigem schwarzen Haar, marineblauer Feldjacke und grauem T-Shirt.
Für ein geschäftliches Gespräch verwenden Sie ein kontrastierendes Paar:
Charakter A: Großer Mann mit silberner Brillenfassung, anthrazitfarbenem Anzug, hellblauem Hemd und schwarzem schmalen Notizbuch.
Charakter B: Kleinerer Mann mit kahlem Kopf, olivgrüner Overshirt, weißem T-Shirt und bernsteinfarbenen Brillengläsern.
Beachten Sie, was in den Ankern bewusst weggelassen wird: Stimmung, Metapher, eine imaginierte Vorgeschichte sowie Aktionen, die nur einmal stattfinden. „Nervös“, „charismatisch“ oder „für eine regnerische Zukunft gekleidet“ sind weniger stabil als beobachtbare Merkmale. Ein guter Anker enthält Rolle, Haarform, Kleidungsfarbe und ein markantes Accessoire; ein hervorragendes Paar weist keinerlei visuelle Überschneidungen in der Kurzbeschreibung auf.

Geben Sie dem Modell zwei klar unterscheidbare Identitäten, bevor Sie ihn auffordern, ein Gespräch darzustellen.
Wenn Platzierung und Blickrichtung der Kamera wichtiger sind als Textur, planen Sie den Raum zunächst mithilfe der Seedance-2.5-Weißmodell-Anleitung. Ein einfacher räumlicher Plan verhindert, dass der Zuhörer beim Wechsel zur Sprechereinstellung plötzlich über die Achse springt.
Native Audio und Dialogsynchronisation in Seedance 2.5
Native Audio ist am zuverlässigsten, wenn visuelle und akustische Anweisungen dieselben Bildausschnitt-Grenzen teilen. Nennen Sie den aktuellen Sprecher namentlich, halten Sie jede gesprochene Zeile kurz und lassen Sie stattdessen eine sichtbare Reaktionsphase folgen – statt beide Charaktere gleichzeitig sprechen zu lassen. Unterschiedliche Stimmbeschreibungen wie „ruhige tiefe Männerstimme“ und „klare, zurückhaltende Frauenstimme“ können die Rollenzuweisung stärken, sollten jedoch die visuellen Kennzeichnungen ergänzen, nicht ersetzen.
Formulieren Sie die Audioanweisung direkt neben der visuellen Rollenzuweisung: „Charakter A spricht eine kurze Zeile von 4–8 s; Charakter B hört schweigend zu.“ Tauschen Sie dann in der nächsten Phase die Rollen. Falls die Lippenbewegung vor dem Wechsel des zugewiesenen Sprechers beginnt, verkürzen Sie den Satz, verlängern Sie die Einstellung und generieren Sie ausschließlich diesen Bildausschnitt neu. Versuchen Sie nicht, ein Missverhältnis zwischen zwei Sprechern durch Hinzufügen weiterer simultaner Dialoge zu korrigieren.
Behandeln Sie gesprochenen Dialog als testbare Ebene. Validieren Sie zunächst eine stumme Version hinsichtlich Gesichtsausdrücke, Kopfdrehungen und Augenlinien; fügen Sie danach einfache Zeilen und stimmliche Kontraste hinzu. Die Anleitung zum native-audio-Videogenerator beschreibt einen umfassenderen Workflow für tonorientierte Clips, während diese Seite sich darauf konzentriert, wer in einem gemeinsamen Bildausschnitt jeweils für welche Zeile verantwortlich ist.
Häufige Fehler und ihre Behebung
Gesichter verschmelzen nach der Gegen-Einstellung. Die Ankerphrasen sind zu ähnlich oder wurden abgekürzt. Stellen Sie die vollständige Phrase für beide Personen zu Beginn jedes Bildausschnitts wieder her und machen Sie Garderobe oder markantes Accessoire deutlich unterscheidbar.
Die falsche Person spricht. Der Prompt benennt den Dialog, aber nicht den Zuhörer. Benennen Sie beide explizit: „Charakter A spricht; Charakter B hört rechts im Bild zu.“ Gestalten Sie den nächsten Bildausschnitt symmetrisch, anstatt lediglich „dann antwortet er“ zu formulieren.
Die Charaktere tauschen ihre Bildseite. Die Szene enthält keine klare Bildrichtung. Legen Sie diese bereits in Bildausschnitt 1 fest und wiederholen Sie in den Mittelaufnahmen „A links im Bild, B rechts im Bild“. Verwenden Sie bei Bedarf eine initiale Referenz oder ein einfaches Layout, falls die räumliche Anordnung entscheidend ist.
Der Zuhörer erstarrt unnatürlich. Geben Sie der passiven Figur eine ruhige Nebenhandlung: beobachtet A, nickt einmal, hält die Tasse oder legt eine Hand auf den Tisch. Fordern Sie nicht gleichzeitig separate dramatische Aktionen an.
Der Ton kommt verspätet oder überlappt. Machen Sie jede Zeile kürzer, trennen Sie die Sprechphasen durch eine Pause und synchronisieren Sie den Sprecherwechsel mit einer Kamerabewegung bzw. -einstellung. Ein sauberes 15-Sekunden-Ergebnis ist wertvoller als eine hastig zusammengestellte Mini-Szene.
3 sofort einsatzbereite Seedance-2.5-Dialogszene-Vorlagen
1. Stille Wiederbegegnung · 15 Sekunden · 16:9
Charakter A: Frau mit kurzem dunklem Bob, rostrotem Regenmantel, cremefarbenem Pullover und Canvas-Schultertasche.
Charakter B: Mann mit kurzem lockigem schwarzen Haar, marineblauer Feldjacke und grauem T-Shirt.
[0–4s] Weitwinkel-Zweieraufnahme in einem Tageslicht-Café am Bahnhof; A links im Bild, B rechts im Bild.
[4–8s] Mittelaufnahme auf A; A spricht eine kurze Begrüßung, B hört rechts im Vordergrund zu.
[8–12s] Mittelaufnahme auf B; B antwortet leise, A hört links im Vordergrund zu.
[12–15s] Nah-Zweieraufnahme; beide verharren kurz und lächeln leicht, Haltezeit 1,5 Sekunden. Natürlicher Raumklang, keine Musik.
2. Produkt-Review-Partner · 15 Sekunden · 9:16
Charakter A: Frau mit schulterlangem kupferrotem Haar, cremefarbener Overshirt und kleiner silberner Uhr.
Charakter B: Mann mit kurz geschnittenem Haar, grünem Hoodie und schwarzem Messenger-Bag.
[0–4s] Vertikale Zweieraufnahme an einer hellen Werkbank; das Produkt zentriert zwischen ihnen.
[4–9s] A weist auf ein Merkmal hin und spricht eine kurze Zeile; B schaut auf das Produkt.
[9–13s] B dreht das Produkt einmal und antwortet; A hört weiterhin links im Bild zu.
[13–15s] Beide blicken auf das Produkt, saubere zentrierte Halteposition. Keine Logos oder On-Screen-Texte.
3. Büro-Entscheidung · 20 Sekunden · 16:9```text
Figur A: großer Mann mit silbernen Brillenrahmen, anthrazitfarbenem Anzug, hellblauem Hemd und schwarzem, schlankem Notizbuch.
Figur B: kleinerer Mann mit kahlem Kopf, olivfarbenem Overshirt, weißem T-Shirt und bernsteinfarbenen Brillengläsern.
[0–5 s] Weitwinkel-Zweieraufnahme in einem taghell erleuchteten Besprechungsraum; A links, B rechts, am selben Tisch.
[5–10 s] Mittelnahe Einstellung auf A; A schließt das Notizbuch und formuliert eine prägnante Entscheidung; B hört zu.
[10–15 s] Mittelnahe Einstellung auf B; B nickt einmal und gibt eine prägnante Antwort ab; A hört zu.
[15–20 s] Zweieraufnahme; beide stehen auf und sammeln ihre Unterlagen ein; die Kamera bleibt ruhend, während sie gemeinsam aus dem Bild gehen.
Testen Sie die Struktur zunächst mit fiktiven Figuren, bevor Sie die vorgegebenen Referenzen hinzufügen – und zwar erst dann, wenn die Zeitangaben korrekt funktionieren.
Seedance 2.5 im Vergleich zu anderen KI-Tools für Dialoge mit mehreren Figuren
Bei Dialogen mit mehreren Figuren kommt es auf den Workflow an – nicht auf Marketingbegriffe. Stellen Sie sich vier Fragen:
Kann jede Figur eine eigene Referenz erhalten?
Kann die Prompt-Angabe in zeitlich festgelegten Abschnitten jeweils Sprecher und Zuhörer namentlich benennen?
Unterstützt der Workflow einen kontrollierten Startframe?
Können Sie eine fehlgeschlagene Gegen-Einstellung („reverse shot“) erneut generieren, ohne die gesamte Szene neu aufbauen zu müssen?
Tools, die ausschließlich eine einzige Szenenbeschreibung akzeptieren, eignen sich gut für attraktive Einzelgespräche – erschweren aber die Identifikation, sobald nach einem Schnitt das Gesicht einer Figur „abdriftet“. Ein workflowbasiertes Referenzsystem pro Figur bietet konkretere Korrekturmaßnahmen: Verbessern Sie eine einzelne Referenz, stärken Sie einen einzelnen Anker oder generieren Sie den gescheiterten Abschnitt neu. Dies ist besonders wertvoll bei Werbespots, Szenen mit markenspezifischer Kleidung sowie jedem Dialog, der mit passgenauen Nahaufnahmen geschnitten werden muss.
Seedance 2.5 ist die praktische Wahl, wenn Sie von einer genehmigten Referenz zu einem geplanten Mehrbild-Ergebnis übergehen möchten. Halten Sie das Erscheinungsbild beider Figuren klar voneinander getrennt, formulieren Sie jede Sprech- und Zuhöranweisung explizit, und bewerten Sie das Ergebnis abschnittsweise – nicht nur anhand des besten Einzelbilds.
Fazit
Ein Dialog zwischen zwei Personen funktioniert, wenn das Modell niemals raten muss, wer wer ist oder gerade spricht. Geben Sie jeder Figur eine dedizierte, saubere Referenz, wiederholen Sie deren vollständige Ankerphrasen in jedem Abschnitt, etablieren Sie die Bildrichtung bereits in der Eröffnungsaufnahme und wechseln Sie strikt zwischen genau einem aktiven Sprecher pro Abschnitt. Beginnen Sie mit einem ruhigen, kurzen Austausch; sobald Identitäten, Sprechwechsel und Tonspur synchron laufen, können Sie die Struktur schrittweise auf eine umfangreichere Szene ausdehnen.
Erstellen Sie ein Multi-Figuren-Seedance-Video →
Bereit, es selbst auszuprobieren?
Setzen Sie die Schritte aus diesem Leitfaden direkt in Seedance um und verwandeln Sie Prompts oder Bilder in wenigen Minuten in fertige Videos.
Kostenlose Credits bei der Anmeldung. Tarife ab $20/Monat.
Verwandte Artikel
Weitere Beiträge in derselben Sprache, die Sie als Nächstes lesen könnten.

Seedance-2.5-Seitenverhältnis-Leitfaden: Erklärung der Formate 16:9, 9:16 und 1:1
Wählen Sie das richtige Seedance-2.5-Seitenverhältnis für YouTube, TikTok, Reels, Shorts, kinematografische Videos, Produktshots und Social-Media-Werbung.
Artikel lesen
So erstellen Sie eine Spec-Ad mit Seedance 2.5: Creative Brief, Prompt und 30-Sekunden-Workflow
Erfahren Sie, wie Sie mit Seedance 2.5 eine professionell gestaltete Spec-Ad auf Grundlage eines kreativen Briefs, Referenzmaterialien, strukturierter Prompts, eines 30-Sekunden-Shotplans und eines praktischen Review-Workflows erstellen.
Artikel lesen
So erstellen Sie ein Musikvideo mit Seedance 2.5: Vollständiger Leitfaden für Kreative
Erfahren Sie, wie Sie ein komplettes KI-Musikvideo mit Seedance 2.5 planen, per Prompt generieren und bearbeiten – inklusive fünf visueller Stile und sofort einsatzbereiter Prompts.
Artikel lesen