MiniMax H3 キャラクター置換ワークフロー:ショットを維持

E
Emma Chen·読む時間: 約1分·Sep 9, 2026
Xで共有
MiniMax H3 キャラクター置換ワークフロー:ショットを維持

AI Overview

動画内のキャラクターを MiniMax H3 で置き換えるには?

クリーンなアイデンティティ画像とソース動画をそれぞれ別個の参照として用い、Ref2VA モデルファミリーを使用します。誰が変更されるかを明確に定義し、元のパフォーマンスおよびカメラ設定を保持したうえで、単一の魅力的なフレームではなく、全体の動きを含む完成した出力を確認してください。

MiniMax H3 によるキャラクター置換に最適なプロンプトは?

<Picture 1><Subject 1><Video 1>、および再利用する音声を含むすべての要素に明示的な役割を割り当てます。置換内容は一度だけ記述し、その後、維持しなければならないソース要素(タイミング、動作、構図、ライティング、環境、インタラクション、サウンド)をリストアップします。

キャラクター置換後のアイデンティティドリフトを防ぐには?

まず、均一な照明下で撮影された頭部~肩までの参照画像を1枚用意し、ソースクリップは短く保ちます。また、同一テスト内でワードローブ、ロケーション、カメラ設定、およびアイデンティティを同時に変更しないよう注意してください。モーション中にドリフトが発生した場合は、動作を簡略化するか、難易度の高いセクションを分割します。

MiniMax H3 で元の動画の音声を維持できますか?

Ref2VA は動画および音声の参照を受け付け、同期されたステレオ音声を生成できます。ソースサウンドトラックを必ず維持する必要がある場合、その音声を「再利用ソース」として明示的にラベル付けし、出力全体におけるダイアログのタイミング、ルームトーン、エフェクト、カット位置を検証してください。

明るいガラス屋根の駅を、赤いレザージャケットを着た銀髪の女性が走り抜ける様子。周囲の群衆はぼやけて見える

成功した置換では、新しいアイデンティティが明瞭に認識できる一方で、元のパフォーマンス、カメラのエネルギー、環境が依然として「ひとつのショット」であるかのように感じられます。

置換契約の定義

MiniMax H3 によるキャラクター置換ワークフローには、2つの並行する課題があります:新しいアイデンティティを導入すること、およびソース動画の有用な要素をすべて保護することです。ユーザーは、通常、テキストから動画を生成するような新規シーンを求めていません。代わりに、すでにタイミング、振り付け、カメラ運動、ライティング、インタラクション、あるいは音声といった、維持したい要素を有していることがほとんどです。したがって、このタスクは曖昧な再生ではなく、「編集」なのです。

モデルを読み込む前に、置換契約を作成してください。許容される変更と不変の要素を明確に分離します:

決定事項 明示的に記述する
置換対象 どのパフォーマーが変更されるか(位置、衣装、または動作で特定)
置換範囲 顔のみ、全身、人物+衣装、またはその他の可視対象
アイデンティティのソース 顔、髪型、年齢、プロポーション、および承認済み衣装を定義する画像
ソース構造 維持すべきタイミング、振り付け、カメラパス、カット、接触、環境
音声の役割 同期トラックの再利用、音声のみの参照、または新規音声生成
出力仕様 再生時間、アスペクト比、構図、および受入基準

「女性を置き換える」という曖昧な指示は避けてください(複数の女性が登場する場合)。代わりに「画面左から登場する赤いコートのパフォーマーを置き換える」と明確に記述します。また、「全身置換」を要求しつつ「元の衣装はそのまま」とも指示するのは避けます。これでは衣装の所有権が不明確になります。契約によって、高コストな実行前に矛盾点を可視化できます。

本ページは編集タスクを主に扱います。Ref2VA と FL2VA の比較ガイドでは、モデルファミリー選択についてより広範に解説しています。参照役割の維持か、正確な終了フレームの再現か、まだ判断がつかない段階でご活用ください。

雨上がりの広場で、同じ銀髪・赤ジャケットの女性が、ワイド、ミディアム、クローズアップの各ショットにおいて一貫して認識可能

アイデンティティの評価は、複数の距離(ショットサイズ)で行う必要があります。説得力のあるクローズアップが、ワイドショットでのアクションシーンでも成立することを保証するものではありません。

ソース動画およびアイデンティティ参照の準備

アイデンティティ画像と編集可能なソース動画を組み合わせて置換を行う場合、H3-Base-Ref2VA を使用します。MiniMax は、Ref2VA を「オムニリファレンス」ファミリーとして文書化しています:これはテキストに加え、画像・動画・音声を参照として受け付ける一方、FL2VA はゼロ・1枚・2枚の終了フレーム画像を中心に設計されています。現在のオープンソース仕様では、規定された再生時間およびファイル数制限内において、最大9枚の画像、最大3本の動画クリップ、最大3本の音声クリップを受理可能です。ただし、最大容量=推奨値ではありません。

最小限の有効な証拠セットから始めましょう。複数の矛盾するポートレートより、1枚の頭部~肩までのアイデンティティ画像の方が有効な場合が多いです。均一な照明、明瞭な生え際、遮られていない目、自然な肌質、およびソース中の最も難しい瞬間に近いアングルを優先します。最初のテストで不足が明らかになった場合(例:横顔の形状や全身の衣装など)のみ、2番目のビューを追加します。

ソースは、1つの意味ある動作に絞ってトリミングします。カメラ移動を1回含む5~8秒のセグメントは、複数のカット・被写体の隠蔽・ライティング変化を含む長尺クリップよりも診断が容易です。また、該当映像の編集権および置換後の肖像の使用権を有していることを確認してください。キャラクター置換は、説得力のある偽のパフォーマンスを生み出す可能性があり、許諾および開示は制作上の必須要件であり、プロンプトの任意項目ではありません。

生成前に、以下の5つの圧力ポイントを検査してください:

  1. 置換対象が他の人物と交差または接触する箇所
  2. 手・髪・小道具・家具などが顔または身体を覆っている箇所
  3. パフォーマーが正面から横顔または背面へと向きを変える箇所
  4. ショットがクローズアップからワイド構図へと移行する箇所
  5. 強い光・反射・モーションブラーにより、可視のアイデンティティ証拠が変化する箇所

「遠距離顔ワークフロー」(distant-face workflow)は、上記4番目の問題を個別に扱います。数ピクセルしか占めない顔に対して、ポートレートレベルのディテールを要求しないでください。

コピー準備完了 MiniMax H3 キャラクター置換プロンプト

MiniMax の公式完全参照形式では、被写体定義、要約、保持分析、詳細な再生描写、サウンドスケープ、および音楽が明確に分離されています。以下のテンプレートは、この構造を実用的な単一キャラクター置換ブリーフへと適応させたものです。角括弧内は、ご自身の正式承認済みメディアから得た事実で置き換えてください。実際に使用しない参照については、役割(ロール)を追加しないでください。

subject_definitions:
<Subject 1> は <Picture 1> から取得した置換パフォーマーであり、[顔、髪型、
年齢層、体型、衣装、およびアイデンティティの固定要素] を含む。
<Subject 2> は <Video 1> に登場するパフォーマーであり、[位置/動作識別子] を行う。
<Video 1> はターゲット動画編集のソース動画である。
<Audio 1> は <Video 1> と同期した音声トラックであり、再利用される。

summary:
[動画編集 + 参照生成 + 音声再利用]
ターゲット動画は <Video 1> の編集版である。<Subject 2> を <Subject 1> で置換する。
オリジナルのタイミング、パフォーマンス、カメラ動き、構図、カット、環境、ライティング、
インタラクション、および <Audio 1> をすべて保持する。

retention_analysis:
<Subject 1>: attribute_transfer — アイデンティティおよび承認済み衣装が、
ショット全体にわたり <Subject 2> を置換する。
<Video 1>: fully_preserved — タイミング、振り付け、カメラ、環境、ライティング、
および他のパフォーマーは構造的に変更されない。
<Audio 1>: fully_copy — 同期されたソース音声トラック全体を再利用する。

detailed_description:
ターゲットはソース動画のビジュアルスタイルおよびペーシングを維持する。
[Shot 1] 開始時の可視構成(置換パフォーマーの立ち位置、動作、被覆状態、接触、
カメラ動き、音響)を記述する。
[Shot 2] 00:00.000 で、ソースにカットが存在する場合のみ、次のカットを記述する。

overall_soundscape:
<Audio 1> を再利用し、セリフのタイミング、アンビエンス、エフェクトを変更しない。

non_diegetic_music:
<Audio 1> に既に含まれる音楽を再利用し、新たな音楽は追加しない。

要点は役割の明確化です。「<Subject 1>」は再利用可能な可視アイデンティティを記述します。「<Video 1>」はソース編集とその時間的構造を特定します。「<Audio 1>」は、音声トラックが意図的に再利用または参照される場合にのみ存在します。ソースに音声があるものの、ターゲットで新規音声を生成すべき場合は、そのトラックを「完全コピー」としてラベル付けしないでください。

ホスト型参照ワークフローでは、MiniMax H3 ジェネレーター を利用すると、ローカルグラフおよび個別のチェックポイントファミリーを維持するよりも簡便な出発点が得られます。

Ref2VA を制御されたテストとして実行

ベースラインのために、プロンプト、シードポリシー、再生時間、アスペクト比、およびソースファイルを固定します。短いワンテイクを1本生成します。初回レビューでは完成度を無視し、「意図したパフォーマーが全フレームで正しく置換されたか?」のみを確認します。2回目のレビューでは、新規出力とソース動画を同一再生速度で並べて比較します。置換は、ソースの動作が読み取れる状態で維持されている場合にのみ合格とみなされます。

MiniMax H3 reference-to-video output for full-motion inspection

この文書化された MiniMax H3 参照出力は、なぜアイデンティティ、ボディモーション、カメラ連続性、および音声を一体となってレビューすべきかを示す好例です。

6項目の評価スコアカードをご活用ください:

チェック項目 合格条件
アイデンティティ 顔、髪型、体型、および承認済み衣装が認識可能である
覆蓋範囲 置換が全必須フレームにわたって継続している
モーション タイミング、ジェスチャー、接触、および運動量がソースに従っている
環境 建築物、小道具、ライティング、および他のパフォーマーが安定している
音声 セリフ、アンビエンス、エフェクト、および口の動きのタイミングが整合している
出力仕様 クロップ、再生時間、解像度、および安全領域が宛先仕様と一致している

結果をポスターフレームだけで承認しないでください。通常速度で再生後、最も厳しい被覆状態および被覆解除後の明瞭なビューへの遷移を、スクロール再生で確認してください。reference-to-video workspace は、より複雑な編集を構築する前に、アイデンティティおよびモーション参照をテストする目的で有効です。

アイデンティティドリフトおよびソース漏洩の修正

元のパフォーマーが数フレームだけ復帰する場合は、ターゲットのアイデンティティ特定を強化し、置換が継続すべき箇所を明記してください。新規の顔が開始時では正確だが、顔を向け替える際にドリフトする場合は、互換性のある横顔参照を追加するか、向き替えをより短いテストに分割してください。顔は維持されるものの元の衣装が露出する場合は、衣装が置換アイデンティティに属するのか、あるいは保持されるソースパフォーマンスに属するのかを明確に判断し、その選択を一度だけ明記してください。

被覆失敗には、形容詞の追加ではなく、時間軸上の証拠が必要です。接触前のフレーム、最も被覆されたフレーム、および接触後の最初の明瞭なフレームをレビューしてください。髪の後ろを手が通過する場合、再出現時に同じ解剖学的構造を保つ必要があります。ジャケットの前を犬が横切る場合、犬が胴体と融合してはなりません。他のパフォーマーの腕が、置換アイデンティティを継承してはなりません。

置換パフォーマーは日差しが差し込むキッチンで犬に挨拶しながら、顔・赤いジャケット・手・接触を一貫して維持

被覆後のフレームが決定的です:被写体が部分的に隠れた後でも、アイデンティティおよび解剖学的構造が明確に復帰しなければなりません。

環境が変化する場合は、編集範囲を縮小してください。「パフォーマーを置換し、部屋はそのままにする」は、「新しい人物+新しい場所+新しい天候+新しいカメラ」を一括で要求するよりも明確です。environment-consistency guide では、空間的関係性を保護するための別途チェックリストをご提供しています。

同一性、口唇同期、音源レビューのための対話モーションサンプル

この Seedance ライブラリクリップは検査用の例であり、MiniMax のベンチマークではありません。対話置換の評価が、同一性、口唇タイミング、部屋のトーン、カットのすべてを含む総合的な判断である必要がある理由を確認するためにご活用ください。

Seedance Agent を活用してワークフローをスケールさせる

単一の置換は手動で管理できます。しかし、連続したシーンになると、それは即座に調整・連携の課題へと変わります:複数のソースクリップ、同一性のアングル、衣装に関するルール、承認済みテイク、音声の権利関係、モデル選択、再実行時のメモなど——これらすべてを正しいショットに正確に紐づけたまま維持する必要があります。Seedance Agent は、置換契約をプロジェクト概要書へと変換し、承認済み参照素材を整理し、ショットを MiniMax H3 へと適切にルーティングし、計画された生成結果を承認待ち状態で保持することができます。

最初の結果が出た後は、「ランダムなバリエーションを依頼する」のではなく、1つの拒否理由のみを記録してください。エージェントは承認済みクリップを保持し、失敗したショットのみを修正し、次のビートへと同一の同一性および環境アンカーを引き継ぎます。この点こそが、コンバージョンの有用性が発揮される場所です:ユーザーには、もう一つの汎用ジェネレーターではなく、参照選択・生成・レビュー・最終アセンブリの間で失われる意思決定を減らすことが求められています。

2人のダンサーが、3つの構図にわたり、それぞれの同一性、衣装、手の接触、スタジオの反射、振付を維持

複数パフォーマーのショットでは、各パフォーマーの同一性所有権および接触状態を個別に確認する必要があります。そうしないと、一方の置換が他方の俳優に悪影響を及ぼす可能性があります。

人間による承認は、以下の2つのゲートで行うよう厳守してください:
① 信用(クレジット)を消費する生成を開始する、および
② 置換クリップが最終編集に組み込まれるです。
エージェントは証拠と状態を統括・調整しますが、無許可の類似表現を許容可能な制作資産へと勝手に変換することはありません。

結論

信頼性の高い MiniMax H3 キャラクター置換ワークフローとは、この作業を「制御された動画編集」として扱うことです。すなわち:
・1つの置換対象を明確に定義する、
・同一性をソースとなるパフォーマンスから分離する、
・Ref2VA を選択する、
・最小限かつ互換性のある参照セットを用いる、
・明示的な保持ルールを記述する、
・動くクリップ全体を、カバレッジ・同一性・接触・環境・音声・配信品質の観点から総合的に評価する——
これらを実践します。不具合が発生した際は、基盤として機能している設定を維持したまま、原因のうち1つだけ(参照アングル、編集範囲、アクション長、役割定義など)を変更してください。参照素材の管理、承認プロセス、ショット単位での再実行、および長尺シークエンスにおける連続性の確保には、プロジェクトを Seedance Agent で始めてください

自分でも試してみますか?

このガイドの手順をSeedanceでそのまま試し、プロンプトや画像を数分で完成度の高い動画に変えましょう。

登録で無料クレジット。プランは月額$20から。