- Блог
- MiniMax H3 Двухперсонажный видеопоток: сохранение ролей, диалогов и движений
MiniMax H3 Двухперсонажный видеопоток: сохранение ролей, диалогов и движений

AI Overview
Может ли MiniMax H3 генерировать двух людей в одном видео?
Да. H3 способен размещать несколько персонажей, однако каждому человеку необходимо задать чёткую индивидуальность, позицию, действие и реплику. Короткая сцена с одним взаимодействием работает надёжнее, чем перегруженный промпт с несколькими одновременными движениями.
Как предотвратить перепутывание личностей двух персонажей?
Назначьте стабильные метки, например Subject 1 и Subject 2, наделите каждого уникальным гардеробом и позицией на экране, повторяйте только те признаки, которые должны сохраняться неизменными. Используйте отдельные опорные изображения, когда критически важна точность идентификации.
Как оформлять диалог двух персонажей в MiniMax H3?
Назначьте говорящим стабильные идентификаторы, например S1 и S2, указывайте имя говорящего перед каждой репликой и помещайте в тег диалога только точный текст реплики. Уточните, что рот слушателя остаётся закрытым.
Какой режим H3 лучше всего подходит для сцены с двумя персонажами?
Используйте текстовый режим или режим первого кадра для простой вымышленной сцены, режим первого и последнего кадров — для одного контролируемого перехода, а режим полных опорных данных — когда отдельные изображения, движения или аудиофайлы должны определять двух персонажей.
Выбор подходящего режима H3 для двух персонажей
Пусть самое жёсткое ограничение определит входной режим
Рабочий процесс создания видео MiniMax H3 с участием двух человек начинается до написания промпта. Определите, что именно должно быть строго контролируемым. Генерация «текст → аудио → видео» достаточна, если оба персонажа могут быть вымышленными. Один первый кадр полезен, когда уже важны композиция начала сцены, гардероб и относительные позиции. Режим первого и последнего кадров удобен, когда единственное взаимодействие должно завершиться в заранее известном состоянии — например, один человек передаёт чемодан другому.
Режим полных опорных данных предпочтителен, когда персонаж А и персонаж Б берутся из разных опорных изображений, когда отдельное видео задаёт движения тела или когда важны опорные аудиофайлы. В MiniMax допускается до девяти опорных изображений, трёх видео и трёх аудиоклипов — всего до 12 опорных файлов. Опорный аудиофайл не может быть единственным входным данными; он должен сопровождаться изображением или видео. Не объединяйте задачи управления кадрами и полных опорных данных в один запрос.

Иллюстративный сгенерированный опорный кадр: два контрастных пальто, отдельные силуэты, фиксированная платформа и один общий реквизит создают чёткие якоря непрерывности.
Используйте продолжительность как бюджет действий. H3 поддерживает видео длительностью от 4 до 15 секунд, однако 15 секунд — это не разрешение уместить больше сюжета. Двум персонажам выделите одну причинно-следственную единицу: приближение, обмен и завершение; вопрос, ответ и реакция; или вход, замечание и уход. Если сцене требуется вторая локация или ещё одно крупное действие, создайте новый клип и соедините его с предыдущим в рамках многокадрового рабочего процесса с возможностью возобновления.
Определение Subject 1 и Subject 2
Создание компактной карточки идентичности и расстановки
Опишите двух персонажей как отдельные производственные записи до составления временной шкалы. Каждая карточка должна содержать видимую идентичность, гардероб, начальную позицию, владение реквизитом, ограничение движений, идентификатор говорящего и источник опорных данных. Различия должны быть сразу заметны; формулировка «двое людей в тёмных куртках» порождает неоднозначность.
| Контроль | Subject 1 | Subject 2 |
|---|---|---|
| Идентичность | Женщина, начало 30-х, короткие тёмные кудри | Мужчина, середина 30-х, коротко остриженные волосы |
| Гардероб | Шерстяное пальто ржаво-красного цвета, коричневые ботинки | Полевая куртка глубокого бирюзового цвета, тёмные ботинки |
| Начальная позиция | Слева от кадра, рядом со скамейкой | Справа от кадра, у стены вокзала |
| Состояние реквизита | Держит ручку чемодана | Поддерживает корпус чемодана |
| Идентификатор говорящего | S1 | S2 |
| Ограничение движений | Один шаг вперёд, отпускает ручку | Принимает чемодан, делает шаг назад |
В режиме полных опорных данных укажите, какой вклад вносит каждый ресурс. Метка субъекта представляет собой повторно используемое видимое содержимое, тогда как метки «Изображение», «Видео» и «Аудио» идентифицируют исходные медиафайлы или структурные опорные данные. Не называйте всё первое изображение Subject 1, если оно содержит двух людей и локацию. Уточните, что Subject 1 — это женщина с Изображения 1, а Subject 2 — мужчина с Изображения 2; платформу определяйте отдельно только в том случае, если её необходимо активно переиспользовать.
subject_definitions:
<Subject 1> — женщина с <Picture 1>, сохраняющая её короткие тёмные кудри, ржаво-красное пальто, лицо и коричневые ботинки.
<Subject 2> — мужчина с <Picture 2>, сохраняющий его коротко остриженные волосы, глубокую бирюзовую куртку, лицо и тёмные ботинки.
<Subject 3> — небольшой серебристый оборудование-чемодан с <Picture 3>, сохраняющий его размер, ручку, защёлки и матовую металлическую отделку.
Не описывайте лица иначе в последующих кадрах. Стабильные метки снижают конкуренцию между прилагательными и опорными данными. Для якорей сцены, которые должны сохраняться при изменении ракурса, в руководстве по согласованности окружения MiniMax H3 показано, как именовать архитектурные элементы, направление света, мебель и фоновые объекты без превращения промпта в каталог.
Расстановка взаимодействия и передачи реквизита
Описывайте изменения состояния, а не только намерения
Фраза «они естественно обмениваются чемоданом» скрывает самые сложные кадры. Опишите состояние объекта в порядке воспроизведения: Subject 1 держит ручку; Subject 2 кладёт обе руки под чемодан; оба кратковременно поддерживают его; Subject 1 разжимает пальцы и отводит руку; Subject 2 делает шаг назад с чемоданом; оба принимают завершённую позу. В этом случае модель получает наблюдаемый путь, а не расплывчатое социальное действие.

Иллюстративный сгенерированный кадр блокировки: говорящий выполняет жест, слушающий сохраняет чёткую линию взгляда, а чемодан находится в устойчивом положении перед передачей.
Соблюдайте последовательность пространственной терминологии. «Слева от экрана» и «справа от экрана» относятся к положению камеры; выражения «возле путей» и «возле стены вокзала» лучше сохраняют свою ясность при смене ракурса. При монтажном склейке, меняющей ориентацию кадра, перед следующим действием заново установите положение обоих персонажей. Используйте только одно движение камеры за раз — например, медленное приближение к паре — вместо комбинации дугового движения, зума, панорамирования и дрожания «ручной» камеры.
Ошибки с руками возникают, когда оба персонажа тянутся сквозь друг друга или промпт пропускает фазу контакта. Обеспечьте чемодану достаточный размер для двух чётко различимых хватов, не допускайте пересечения тел персонажей и выделите несколько секунд на сам процесс передачи. Важно чёткое завершение: укажите, кому принадлежит чемодан, где стоит каждый персонаж, куда направлен их взгляд и двигаются ли губы хотя бы одного из них.

Иллюстративный сгенерированный кадр действия: проверьте разделение рук, геометрию реквизита, непрерывность пальто и отсутствие лишней руки во время совместного контакта.
Контроль диалога и звука между двумя говорящими
Назначьте каждую реплику и каждый такт внимательного слушания
Официальное базовое руководство MiniMax использует стабильные идентификаторы говорящих, такие как S1 и S2. Помещайте идентифицирующую фразу, идентификатор говорящего, способ подачи и действие вне тега диалога; внутри тега оставляйте только языковой тег и точный текст реплики. При одновременной речи двух персонажей поддерживается составной идентификатор, например S1,S2, однако перекрывающаяся речь представляет собой более сложную задачу по сравнению с чередованием реплик.
Женщина в ржаво-красном пальто (S1) смотрит на чемодан и тихо говорит: <d>[English] Keep this with you until the next stop.</d> Subject 2 слушает, его губы остаются закрытыми.
Мужчина в бирюзовом пиджаке (S2) принимает чемодан, встречается с ней взглядом и отвечает: <d>[English] I understand.</d> Subject 1 слушает, её губы остаются закрытыми.
Используйте короткие реплики, соответствующие видимому кадру. Указывайте момент окончания речи, момент закрытия челюсти и момент реакции слушателя. Звуковые элементы окружающей среды (фоновый шум платформы), шаги, щелчки застёжки чемодана и шорох ткани включайте в общий звуковой ландшафт, а не дублируйте их как часть диалога. Музыку, предназначенную исключительно для аудитории, помещайте в поле «недиегетическая музыка». Если голос за кадром должен звучать вне кадра, явно укажите это как «голос за кадром», при этом губы персонажа на экране должны оставаться неподвижными.
Фактический результат Seedance, а не результат MiniMax H3: используйте контролируемый клип с одним говорящим в качестве эталона для работы губ, синхронизации и фонового звука помещения до оценки более сложного диалога между двумя персонажами.
Для повторяющихся голосов в нескольких клипах руководство по согласованности голосов в Seedance предлагает прослушивание по параметрам тембра, темпа, громкости, фонового звука помещения и разделения между говорящими.
Создание плана непрерывности из трёх кадров
Сделайте так, чтобы каждый монтажный склей наследовал зафиксированное состояние
Для большинства сцен с двумя персонажами достаточно трёх коротких кадров. Кадр 1 устанавливает обоих персонажей, платформу и начальное владение чемоданом. Кадр 2 приближается для передачи чемодана и содержит по одной реплике от каждого говорящего. Кадр 3 подтверждает нового владельца реквизита и даёт обоим персонажам спокойную реакцию. Каждому кадру присвойте начальное состояние, действие, поведение камеры, звук и зафиксированное конечное состояние.
Конец Кадра 1 должен точно совпадать с началом Кадра 2. Если чемодан находится на скамье в момент склейки, он не может внезапно оказаться в руках Subject 2 в первом кадре следующей сцены без видимого поднятия. Если Subject 1 стоит у путей, не меняйте её положение у стены вокзала без объяснения этого сменой кадра и ориентацией камеры. В рабочем процессе MiniMax H3 с несколькими ключевыми кадрами показано, как назначать упорядоченные кадры общей временной шкале, не рассматривая их как вертикальную коллажную раскадровку.
Базовое руководство H3 позволяет задавать точные временные метки монтажных склеек после Кадра 1. Используйте их только тогда, когда это действительно помогает, и сохраняйте интервалы непрерывными. Практичный 12-секундный план: 0–4 секунды — установка, 4–9 секунд — передача, 9–12 секунд — финальная пауза. Последние две секунды не должны вводить новое действие.

Иллюстративный сгенерированный финальный кадр: одинаковые лица, пальто, скамья, вокзал, чемодан и освещение позволяют легко выявить любые нарушения непрерывности.
Анализ ошибок и повторный запуск минимально возможного фрагмента
Сопоставьте каждую видимую ошибку с одним изменением в промпте
Просмотрите полный видеоролик в нормальном темпе, затем проанализируйте передачу чемодана и диалог в замедленном режиме (вдвое медленнее). Если происходит перепутывание персонажей, укрепите связь «персонаж → ссылка» и упростите монтажный склей. Если лица сливаются в широком плане, увеличьте расстояние между персонажами или перенесите диалог в средний двухперсонажный план; в руководстве по исправлению размытых лиц на расстоянии рассматриваются особенности компоновки кадра и выбора опорных изображений для решения этой проблемы.| Сбой | Вероятная причина | Наименьшее полезное изменение | | --- | --- | --- | | Персонажи меняются ролями | Похожий гардероб или неоднозначные метки | Восстановить различимые метки, одежду, позиции и идентификаторы говорящих | | Движутся оба рта | Поведение слушателя не указано | Добавить фразу «слушает, губы остаются закрытыми» после каждой реплики | | Появляется лишняя рука | Переход пропускает состояние контакта | Расширить фазы совместной поддержки и отпускания | | Реквизит меняет форму | Слишком много действий или слабое определение реквизита | Зафиксировать размеры, ручку, отделку и окончательного владельца | | Взгляды нарушаются после среза | Позиции не переустанавливаются | Повторно указать обе позиции и направление взгляда под новым углом | | Окружающая среда сбрасывается | Якоря сцены были неявными | Повторить платформу, скамью, поезд, направление освещения и время |
Не пересоздавайте корректное вступление заново только из-за сбоя одного кадра перехода. Сохраняйте принятые ссылки на персонажей, версию промпта, seed или запись задачи (если доступно), выходные данные и примечание о сбое. Затем повторно запустите минимальный вариант с одним корректирующим изменением. Seedance Agent может организовать эти ссылки, сравнивать кандидатов, сохранять статус одобрения и направлять через рабочий процесс «ссылка-на-видео» только неудачный сегмент.
Заключение
Надёжный MiniMax H3 рабочий процесс для видео с участием двух человек использует правильный режим ввода, две недвусмысленные записи субъектов, стабильные идентификаторы говорящих S1 и S2, одну причинно-следственную взаимодействие, явные изменения состояния реквизита и план срезов, чьи конечные состояния соответствуют следующим начальным кадрам. Отдельно проверьте идентичность, принадлежность рта, руки, направление взгляда, геометрию реквизита, окружающую среду и звук, затем повторно запустите только неудачный такт. Чтобы хранить ссылки, кадры, одобрения и целенаправленные правки вместе, создайте последовательность с двумя персонажами с помощью Seedance Agent.
Готовы попробовать сами?
Примените шаги из этого руководства в Seedance и превратите промпты или изображения в готовые видео за считанные минуты.
Бесплатные кредиты при регистрации. Тарифы от $20 в месяц.
Похожие статьи
Еще материалы на этом же языке, которые стоит прочитать дальше.

Руководство по раннему доступу к Socialive Catalyst: подготовка полезного первого пилотного проекта
Узнайте, кто может получить доступ к Socialive Catalyst, что входит в раннюю бета-версию, какие шаги необходимо предпринять для демонстрации и как протестировать один фирменный корпоративный видеопроцесс с использованием ИИ.
Читать статью
FramePack Torch CUDA не включен: диагностика и устранение неполадок в правильной среде
Устранение неполадок FramePack при отсутствии поддержки CUDA в Torch путём проверки точной среды выполнения Python, замены wheel-файла только для CPU, решения проблем с драйверами или совместимостью с видеокартами RTX, а также подтверждения успешного восстановления.
Читать статьюРуководство по созданию персонального аватара в Google Vids: запись, запрос и исправление
Создайте персональный аватар в Google Vids, пройдите захват лица и голоса, напишите полезный запрос для Gemini Omni, устраните отсутствие доступа и управляйте своей записью.
Читать статью