MiniMax H3 Ref2V と FL2VA:どちらのワークフローを使用すべきか?

E
Emma Chen·読む時間: 約2分·Sep 5, 2026
Xで共有
MiniMax H3 Ref2V と FL2VA:どちらのワークフローを使用すべきか?

MiniMax H3 Ref2V 対 FL2VA は単純な品質比較ではありません。これらは、異なる種類の制御を目的として設計された2つのタスクファミリーです。Ref2V の正式名称は Ref2VA です。これは、被写体、スタイル、動き、または声を再利用可能な参照として画像、動画、音声を活用します。一方、FL2VA では、1ショットの開始位置、終了位置、またはその両方を定義するためにゼロ枚、1枚、または2枚のキーフレームを使用します。

したがって、実践的な問いは「どちらのチェックポイントが優れているか?」ではなく、「このショットで何を固定しなければならないか?」です。被写体や製品の同一性を新しいカメラアングルおよび環境下でも維持する必要がある場合は、Ref2VA を選択してください。開始時または終了時の構図を厳密に再現する必要がある場合は、FL2VA を選択してください。

AI Overview

MiniMax H3 Ref2V と FL2VA の主な違いは何ですか?

Ref2VA は、被写体、スタイル、動画、または音声といった再利用可能な参照を、新たに構成されたショットへと持ち込みます。FL2VA は、最初のフレームから最後のフレームへ、あるいは両端点間でアニメーション化します。

キャラクターの一貫性を保つために Ref2VA と FL2VA のどちらを使うべきですか?

キャラクターを新しいロケーションやカメラアングルで登場させる必要がある場合は Ref2VA を使用してください。既にアニメーション化したい正確な構図を手に入れている場合は FL2VA を使用してください。

両方の MiniMax H3 モードで音声を生成できますか?

はい。両方のタスクファミリーは、ネイティブのステレオ音声付き動画を生成します。音声クリップまたは声質が参照パッケージの一部である場合、Ref2VA の方がより適しています。

初回テストにはどちらのモードが簡単ですか?

FL2VA の方が通常はシンプルです。1枚の画像と1つのプロンプトから始められるためです。Ref2VA は、単一のフレームに十分な被写体情報、動き情報、または音声情報が含まれていない場合に価値を発揮します。

Ref2VA 対 FL2VA:簡潔な判断基準

これらのモードを比較検討するユーザーは、数百ギガバイト規模の重みファイルを読み込んだり、2つの ComfyUI グラフを構築したりする前に適用できる明確な判断基準を求めています。以下のルールをご利用ください:FL2VA はエンドポイントを保持し、Ref2VA は参照役割を保持します。

制作上の要件 より適した出発点 理由
完成済みの静止画をアニメーション化する FL2VA 元画像が正確な最初または最後の構図となる
設計済みのオープニングとエンディングを接続する FL2VA 2枚のキーフレームで両エンドポイントを定義可能
同じ俳優を異なるロケーションに配置する Ref2VA 同一性を新しいショット構図から分離可能
製品を複数の広告セットで再利用する Ref2VA 複数のビューで形状および素材を記述可能
声、雰囲気音、動きのヒントを再利用する Ref2VA 音声および動画を参照として割り当て可能
画像入力なしでテキストから生成する FL2VA ファミリー 同じチェックポイントファミリーがテキストから動画への変換もカバー

H3 の出力は 24 fps であり、ネイティブの 32 kHz ステレオ音声を備えています。基本ワークフローでは、別途高解像度再生ステージを経ない限り、通常は768pで出力されます。こうした共通の出力仕様は、条件付けにおける差異を解消しません。チェックポイントの選択は、モデルが受け取る証拠の種類を依然として決定します。

マルチモーダル参照割り当ての包括的な紹介については、MiniMax H3 参照動画ガイド をご覧ください。

Ref2VA を選ぶべきケース

「凍結した構図」ではなく「被写体」を求める場合

Ref2VA は、キャスティング(役者起用)として理解するのが最も適切です。認識可能なまま維持すべき「誰」または「何」に関する証拠を与え、その後に新しいショットを描写します。オープンモデルは最大9枚の画像、最大3本の参照動画、最大3つの音声クリップを受け入れられ、参照タイプ全体で合計12ファイルまで可能です。動画および音声参照の長さには制限があるため、各アセットには明確な役割が必要です。

9つのスロットがあるからといって、似たようなポートレート画像を9枚も与えるべきではありません。有用なキャラクターパッケージには、顔の正面ビュー、3/4体の全身ビュー、および衣装のディテール画像が含まれるかもしれません。製品パッケージには、正面、側面、および拡大した形状のビューが含まれるかもしれません。動きの参照は、静止画では伝えきれないタイミングやカメラ移動を示す必要があります。

同じ銀髪のパフォーマーが、雨の路地、砂漠のワイドショット、明るいスタジオのクローズアップという異なるシーンでも認識可能

レンズ、ライティング、環境が大きく変化しても、顔の形、銀髪、コバルト色のジャケット、イヤリングが一貫して識別できることを確認してください——このような証拠こそが、Ref2VA のテストで評価すべきものです。

各参照に1つの役割を明確に割り当てる

強力な Ref2VA プロンプトでは、各入力ファイルの名前とその役割を明記します。「画像1は俳優を定義する」「動画1はドリー運動を提供する」「音声1は声質を提供する」と明言するのは、「すべてのものをすべてからコピーする」ように依頼するよりも明確です。2つの参照が矛盾する場合、顔、衣装、動き、環境、音響のそれぞれについて、どちらの参照が優先されるかを明示してください。

MiniMax H3 Ref2VA official reference-to-video output

公式の Ref2VA テンプレート結果:1枚のシャープなフレームだけを評価するのではなく、新しく生成された動きの中で同一性およびスタイルが維持されているかどうかを評価してください。

コピーアンドペースト可能な構造については、MiniMax H3 プロンプティングガイド で、被写体の定義をターゲットショットおよびサウンドスケープから分離する方法を説明しています。

FL2VA を選ぶべきケース

1枚のフレームですでに答えが得られている場合

ソースが単なるインスピレーションではなく、実際のショットそのものである場合に、FL2VA を選択してください。1枚の画像があれば、それを最初のフレームとして前方へアニメーションさせることも、最後のフレームとして動きがそこに到達するようにすることも可能です。2枚の画像があれば、モデルには明示的な視覚的終点が与えられます。このため、FL2VA は制御された露出(controlled reveals)、マッチ・カット、ループ、タイトルカードの登場、製品の変形、および設計されたポーズで着地しなければならないアクションに有効です。

よくある誤りは、ソースフレームがサポートできないカメラアングルを要求することです。クローズアップのポートレートには、ジャケットの背面、部屋全体、あるいは俳優の歩き方といった情報は含まれていません。FL2VA は欠落している情報を補完できますが、すべての補完は連続性のリスクを伴います。タスクが提供された構図内でのモーションではなく、本質的に新しいショットを必要とする場合は、Ref2VA に切り替えてください。

同一駅内で、一貫したオープニング、空中キックフリップ、そして同じ列車の脇への着地

有効な FL2VA の評価では、中間のモーションが自然であるかを確認するとともに、最終ポーズ、列車の形状、進行方向、衣装が計画通りの終点に収束しているかを検証します。

互換性のある終点を設計する

最初と最後のフレームは、被写体の同一性、衣装、シーンの幾何学的構成、アスペクト比、および妥当な動きについて一致している必要があります。説明のつかない大きな変化は、モデルに複数の課題を同時に解決させることを強いることになります。たとえば、最初の画像が駅に立つ俳優を写し、最後の画像が異なるレンズ、異なる衣装、季節、場所を示す場合、トランジションは限られた時間の大部分を「変形」に費やしてしまう可能性があります。

MiniMax H3 official first-and-last-frame output

公式の FL2VA 結果:終点の精度、フレーム間の経路、およびネイティブ音声が視覚的アクションに追随しているかを確認してください。

MiniMax H3 first-and-last-frame ガイド では、終点設計についてさらに詳しく解説しています。

適切な ComfyUI ワークフローを構築する

必要なタスクファミリーのみを読み込む

MiniMax H3 は、個別の FL2VA および Ref2VA のチェックポイントファミリーを配布しています。これらは、同一のグラフに付随する単なる2つのメニュー項目ではありません。FL2VA はテキストに加えて、任意の最初および最後の画像条件を受け入れます。一方、Ref2VA は順序付きの画像・動画・音声参照と、それら参照とターゲットとの関係を定義するプロンプトを受け入れます。

まず、最小限のグラフで検証を開始してください。FL2VA の場合、クリーンな最初のフレーム1枚、短いモーション指示、固定シード、短い持続時間を用います。単一フレームの結果が自然に動くようになった後で、初めて最後のフレームを追加してください。Ref2VA の場合、まず1枚のアイデンティティ画像と1つのターゲットショットの記述から始めます。失敗の原因が明らかになった時点で、2番目のビュー、モーション動画、または音声クリップを追加してください。

MiniMax H3 ComfyUI 設定ガイド では、ローカルインストールの完全な手順を紹介しています。モデルファミリーは明確な名前のディレクトリに格納し、キャッシュされたローダーが Ref2VA のテストを FL2VA のテストと誤認しないよう注意してください。

参照のリストではなく、ターゲットをプロンプトする

参照を定義した後は、完成した動画を時間順に記述してください。カメラ設定、アクション、環境、台詞、雰囲気音、音楽を明記します。参照画像にすでに見える内容をプロンプト全体で繰り返す必要はありません。Ref2VA には新しいショットの仕様が必要であり、FL2VA には既に可視化されている内容間の妥当なモーションパスが必要です。

同じ依頼事項で両モードをテストする

重要な失敗を評価する

両モードで公平に表現可能な依頼事項のみ、同一のクリエイティブ・ブリーフを両モードで実行してください。持続時間、アスペクト比、プロンプトの意図、シードポリシー、レビュー基準を固定します。その後、アイデンティティ、オブジェクトの幾何学的構成、終点の精度、モーション品質、カメラ制御、音声の関連性、使用可能なフレームレートを評価します。

同一被写体が新しい構図を通過しても存続する必要がある場合は、Ref2VA が優れています。一方、最初または最後の構図が入力と一致しなければならない場合は、FL2VA が優れています。よりシャープなフレームが、誤った俳優を補うことはできません。また、一貫した俳優が、必要な終了カードを欠落させることを補うこともできません。

工房、アパート、海岸の広告セットという異なる環境でも、赤いラジオはグリル、ダイアル、ハンドル、プロポーションを維持

製品の場合、全体の色だけでなく、グリルの幾何学的構成、ダイアルの配置、ハンドルの形状、塗装の摩耗状態、ボタンの数を、さまざまな環境で確認してください。

レンダリング試行回数ではなく、承認済み出力数をカウントする

最もコスト効率の良いワークフローとは、再実行回数を最小限に抑え、承認済みショットを確実に生成できるものです。各バージョンの失敗理由を記録してください。FL2VA が大規模なカメラ移動中に繰り返しアイデンティティを変更する場合、その依頼事項にはおそらく Ref2VA が必要です。Ref2VA が正確なオープニングまたはクロージング構図を繰り返し外す場合、より多くの形容詞を追加する代わりに、その終点を FL2VA で提供してください。

長尺のシーケンスでは、承認済みの結果を MiniMax H3 multi-keyframe ワークフロー に持ち込んで処理し、1回の生成でシーン全体を解決しようとしないでください。

2つのローカルパイプラインを管理したくない場合に Seedance Agent を使用する

ローカルオープンモデル方式は高度な制御を可能にしますが、すべてのショットに対してチェックポイント選択、参照の整理、プロンプトの再構成、バージョン管理、手動による再実行が必要になると、運用コストが増大します。まさにこのような状況において、Seedance Agent が自然に活用されます。エージェントに創造的な目標と参照パックを提示し、最終生成に費用をかける前に提案されたショット計画をレビューしてください。これにより、参照ロールをブリーフに紐付けたままに保つことができ、適切な生成パスを選択し、代替案を整理し、失敗したショットのみを再実行できます(ローカルグラフ全体を再構築する必要はありません)。この機能の有用な利点は、モデルを隠すことではなく、意思決定・根拠・出力・承認履歴を一元管理することにあります。

ノードレベルでの再現可能な制御が必要で、かつ両方のタスクファミリーを維持できるハードウェア環境がある場合は、ローカルの Ref2VA または FL2VA を使用してください。チェックポイントのパイプライン構築を二次的な制作作業と見なさず、参照から承認済みショットへスムーズに移行したい場合は、ホステッド版エージェントをご利用ください。ワークフローはSeedance Agentから開始でき、大規模なシーケンスへのコミット前に実際の出力を比較できます。

結論

MiniMax H3 Ref2V 対 FL2VA の選択は、不変条件(invariant)を定義すれば単純になります。アクター、製品、スタイル、モーション・キューやボイスが新しく構成されたショットでも維持されなければならない場合は、Ref2VA を選択してください。一方、提供された1枚のフレームがアニメーション化すべき正確な構図である場合、あるいは2枚のフレームが開始・終了位置を明確に定義している場合には、FL2VA を選択してください。可能な限り最小のグラフを構築し、各参照に1つの役割を割り当て、承認済み出力率でテストを行い、失敗が発生した際に「守るべきもの」を誤って選択していることを示すサインがあれば、モードを切り替えてください。2つのローカルパイプラインを維持せずに、同一の参照計画・モデル選択・レビュー・部分再実行ロジックを利用したい場合は、Seedance Agent ワークフローをお試しください。

自分でも試してみますか?

このガイドの手順をSeedanceでそのまま試し、プロンプトや画像を数分で完成度の高い動画に変えましょう。

登録で無料クレジット。プランは月額$20から。