MiniMax H3 マイクロエクスプレッションプロンプト:自然で繊細な感情を直接表現

E
Emma Chen·読む時間: 約1分·Sep 10, 2026
Xで共有
MiniMax H3 マイクロエクスプレッションプロンプト:自然で繊細な感情を直接表現

AI Overview

MiniMax H3 のマイクロエクスプレッション・プロンプトはどのように書けばよいですか?

感情の種類、その感情が顔に現れる可視的兆候、引き金となる出来事、およびその感情が落ち着く瞬間を明記します。劇的な感情語を複数並べるのではなく、目がやわらかくなる、あごの緊張が解けるなど、1つの抑制された変化に焦点を当てます。

H3 キャラクターの表情が空白またはロボットのように見えるのはなぜですか?

プロンプトが内面的な感情のみを描写し、観察可能な動作を示していない場合、あるいは複数の競合する感情的「ビート」を同時に要求している可能性があります。顔には明確な原因(トリガー)を与え、1つの読み取りやすい反応を指定し、自然なまばたきと呼吸を含め、さらに中立的な静止状態(ニュートラル・レスト)を明示してください。

MiniMax H3 は参照画像から表情をコピーできますか?

参照モードでは、画像または動画を用いてキャラクターのアイデンティティおよびパフォーマンス信号を伝達できます。各ファイルには明確な役割(例:顔のアイデンティティ用/演技の参照用)を割り当て、表情の転送がキャラクターのアイデンティティを置き換えないよう確認してください。

ダイアログと顔の反応を同時にプロンプトすべきですか?

はい。反応が特定の台詞や一時停止と密接に関連している場合です。表情は発話の直前・最中・直後に配置し、口の動きが台詞内容と整合するよう配慮し、同時に矛盾するカメラ方向(例:ズームインとパンの同時指示)を避けてください。

マイクロエクスプレッション・プロンプトが実際に制御するもの

マイクロエクスプレッション・プロンプトは、視聴者が時間経過とともに観察できる小さな変化を指示すべきです。「彼女は緊張している」というのは演技上のメモですが、どの可視的サインがその感情を伝えるのかをモデルに指示していません。「内側の眉毛がわずかに上がり、唇を一瞬強く押さえた後、息を吐いてあごの緊張を解く」——これは観察可能な行動の明確なシーケンスです。後者の表現は、演出・レビュー・修正のすべてにおいて容易です。

MiniMax H3 はテキスト、画像、動画、音声のコンテキストをサポートし、公式資料では24 fpsで4~15秒の出力を想定しています。これは、顔の「ビート」が出現・ピークに達・落ち着くまでに十分な長さですが、複雑な感情の推移に加えて複数のカメラワークを含めるには不十分です。プロンプトは簡潔なショット・ブリーフとして扱ってください:キャラクター、トリガー、可視的反応、カメラ、サウンド、終了状態。

雨に打たれたプラットフォームで、安堵と心配を同時に抱える女性

有用なターゲットは「悲しそうな顔」ではありません。むしろ、涙を帯びた目、緩み始めたあご、コントロールされた唇、そして依然として警戒を保つ視線——といった、読み取り可能な組み合わせです。

ここでいう「マイクロエクスプレッション」は、臨床的な感情検出ではなく、クリエイティブな演出用語です。アイデンティティ、解剖学的正確性、リップシンクを損なわず、脚本上の感情を伝えるために、小さな可視的ヒントを活用してください。

表情をタイミング付きの「ビート」として構築する

まず中立的なベースライン(静止状態)から始めます。これがなければ、モデルは最大強度から開始し、その後の動きの余地がなくなります。次に、トリガー(例:列車が出発、名前がアナウンス、メッセージが終了、他キャラクターが一時停止)を明記します。その後、互換性のある2~3つの顔のサインを選択し、最後に新しい静止状態を描写します。これにより、ほぼすべてのH3プロンプトに流用可能な4部構成の「ビート」が完成します:

  1. ベースライン: 整った表情、安定した視線、リラックスした肩。
  2. トリガー: 短い沈黙の後に、画面外からの返答を聞く。
  3. レスポンス: 目がやわらかくなり、下まぶたがわずかに持ち上がり、口角の一方がほんの少し持ち上がる。
  4. セトル(落ち着き): 静かに息を吐き、専門家としての冷静さを取り戻すが、視線には依然として懸念が残る。

眉、目、鼻、あご、唇、笑みなど、顔の各部位に個別に命令を与えることは避けましょう。こうした命令の羅列はしばしば矛盾を生みます。代わりに、1つの主要な遷移に集中し、呼吸・姿勢・視線をその補完要素として活用してください。自然なまばたきは、機械的なスケジュールではなく、偶発的な句読点として最も効果的に機能します。

面接の待合室で緊張を隠そうとする就職活動中の人物

控えめな緊張感を表現する際は、眉・唇への圧力・握り具合・姿勢の関係性を検討してください。顔が劇的な恐怖へと一気に跳ぶことはありません。

カメラ距離は、視聴者がそのサインを読み取れるかどうかを決定します。まぶた・口角・あごの変化を強調するには、クローズアップまたはミディアム・クローズアップを使用してください。ワイドなロケーションショットが必要な場合は、感情のピーク前に顔にズームインするか、別ショットで処理してください。顔が小さすぎてパフォーマンスを確実に伝えることができないケースについては、MiniMax H3 face-at-distance guide をご参照ください。

コピー&ペースト可能なマイクロエクスプレッション・プロンプトの4パターン

これらのテンプレートは、公式H3出力として保証されたものではなく、新たに作成された実制作向けパターンです。角括弧内の物語的詳細を置き換え、可視的シーケンスはそのまま維持してください。各パターンは、1つの支配的なパフォーマンス・ビートを要求します。

隠された緊張: 「[場所]の外で待つ[キャラクター]のミディアム・クローズアップ。顔は初め整っている。[トリガー]を聞いた後、内側の眉毛がわずかに上がり、唇が1秒未満の間、ぎゅっと押される。浅い呼吸で胸が上がると、[対象物]を握る指の力が抜ける。表情は意図的な冷静さへと落ち着く。自然なまばたきタイミング、グリマスなし、誇張された恐怖なし。カメラは固定。」

安堵と心配の混在: 「[結果]を読む[キャラクター]のクローズアップ。まず目が輝き、肩の緊張が解け、小さな微笑みがほんのわずかに浮かぶ。その後、視線は[画面外の対象]へ戻り、下まぶたには依然として心配の痕跡が残る。静かな息の吐き出し。終了は祝賀ではなく、コントロールされたプロフェッショナルな落ち着きで。」

スープを味見しながらわずかな失望を表すシェフ

*実用的なプロンプトでは、味見というトリガーと、目を細めること・鼻の緊張・コントロールされた唇といった短い反応を明記し、その後シェフが問題解決へと戻ることを描写します。*個人的な落胆: 「[キャラクター]が[対象物]を味わったり点検したりする際の、きわめて近いアップショット。一瞬だけ、鼻がわずかに引き締まり、目が細くなるが、口は閉じたまま。キャラクターはこの反応に気づき、鼻から静かに息を吸ってから、集中した決意を持って再び作業へと視線を戻す。不快感を表す表情は一切なし、首を急に振ることもなし、コメディ的要素もなし。」

対話中の聞き手の反応: 「[話者]が画外で最後の文を述べる際の、[聞き手]の肩越しのクローズアップ。聞き手は目を合わせたまま、キーワードの直後に一度だけまばたきし、片方の口角がわずかに上がりながら、目元は悲しみを保つ。返答の前に半拍待つ。呼吸と頭部の動きは極めて控えめに保ち、返答時のリップシンクを確実に維持すること。」

4つの例をすべて1回のリクエストに貼り付けないでください。感情の役割(emotional job)を1つ選び、トリガーをそれに合わせて調整し、不要な表現は削除してください。クリップに音声によるセリフが含まれる場合は、再生順にセリフと反応を記述してください。Seedance 2.5における声の統一性の維持方法に関するページでは、生成モデルが異なっていても、ボーカル・パフォーマンスとビジュアル・パフォーマンスをショット間で一致させるための有用なレビュー手法が紹介されています。

モードと参照ロールの選択

テキストから動画への生成(Text-to-video)では、H3が人物・舞台・演技を新たに創出するため、俳優の識別性を損なわない程度にのみ外見を記述します。初フレームの画像から動画への生成(image-to-video)では、すでに開始時の顔と構図が確定しています。そのため、プロンプトのスペースは、動き・表情のタイミング・視線・および変化してはならない要素に割り当てます。初・終フレームモードは、最終的な感情が特定の画像上で正確に成立する必要がある場合に有効ですが、その遷移には依然として妥当なトリガーと抑制された経路が必要です。

参照から動画への生成(Reference-to-video)は、信号が複数の別個のアセットから得られる場合に有効です。ロールを明示的に割り当てます:Picture 1は顔の同一性を担当、Picture 2は衣装を担当、Video 1は抑制された聞き手の演技を提供、Audio 1は声質(timbre)を提供します。演技の動きとタイミングは、ターゲットとなる人物の同一性を置き換えることなく転送されることを明記します。

医師が検査結果を読み、専門家としての落ち着きを取り戻す様子

複合的な感情は、プロンプトが変化の順序を明確に定義することで可読性が高まります:目が輝き、肩の緊張が和らぎ、ほんのわずかな微笑みが浮かび、そして落ち着きが戻る。

メディアを添付する前に、Ref2V と FL2VA の選択ガイドを参照してください。参照画像の数が多いほど自動的に良い結果が得られるわけではありません。競合する顔の角度・表情のピーク・照明条件は、信号を弱める原因となります。単純なポートレートの場合、強い同一性を持つ1枚の画像と、焦点の合った演技の参照画像1枚を用いる方が、類似したファイルが詰まったフォルダよりも診断しやすいことが多いです。

空白・ロボット的・過剰な表情の修正

空白の表情は、通常、プロンプトが気分(mood)を記述しているだけで、変化を指定していないことを意味します。トリガーと2つの可視化可能な手がかりを追加してください。ロボットのような表情は、しばしば固定された凝視・完璧にタイミングされたまばたき・頭部の完全な固定が組み合わさって生じます。自然な呼吸・わずかな視線の調整・非対称性を復元しましょう。過剰な表情は、しばしば「極度に恐怖し、衝撃を受け、打ちのめされた」といった強調語の繰り返しから生じます。これらを、1つの抑制された遷移と否定的境界(negative boundary)——「歪んだ表情なし、目を見開かない、急な首振りなし」——に置き換えてください。

口の動きが不自然な場合は、無言の反応と発話の動きを分離してください。聞き手は相手のセリフ中に反応し、一時停止した後、短い返答を発します。感情のピーク時に同一性が変化する場合は、カメラの移動を減らし、同一性の参照を強化し、表情を簡素化してください。微妙な言い回しが無視される場合は、テキスト/ビジョンエンコーダーと参照パスを確認してください。Qwenエンコーダーの精度ガイドでは、量子化(quantization)による影響と他のワークフロー変更を混同せずに、難解な意味的プロンプトを比較する方法が説明されています。

MiniMax H3 reference-to-video motion sample

この既存のH3参照から動画への生成結果は、微表情のベンチマークではなく、あくまで検査用サンプルです。同一性の安定性・視線・まばたきのリズム・および表情が自然に収束するかどうかを含め、全体の動きを確認してください。

テスト時は、入力・シード値・再生時間・モデル・解像度・カメラ指示を固定したまま行います。1度に1つの表情に関する記述のみを変更してください。有用な3回の試行シーケンスは、ベースライン → 指示を簡略化したもの → トリガーを明確にしたもの、です。より短いプロンプトが機能する場合は、物語に必要な最小限の詳細のみを追加し、元のプロンプト全体を復元しないでください。

プロダクションにおける全パフォーマンスのレビュー

魅力的な一時停止フレームからではなく、動きのある感情で承認してください。通常速度で音声付きで再生し、タイミング評価のため音声をミュートし、また声のリズム評価のため音声のみで再生してください。同一性・視線・まばたきのリズム・口の articulation(発音動作)・頭部の動き・肩の緊張・および重要な瞬間にカメラが十分に近接しているかを確認します。

年配の父親が、喜びと悲しみが入り混じった感情で音声メッセージを聞く様子

複合的な感情には劇的な表情は不要です:目元の柔らかさ・口の非対称的な動き・静かな呼吸だけで、シーンの感情を十分に伝えられます。

マルチショットのシーンでは、各承認済みテイクの後に感情状態の引継ぎ(handoff)を記述します。「電話前の警戒心」「名前を聞いた後の安堵の始まり」「落ち着いているが依然として不確かさを帯びている」など。選択した参照・プロンプト・シード値・承認メモをショットとともに保存します。Seedance Agentは、こうした参照を整理し、適切なタイミングでクローズアップを計画し、レビュアーの判断を収集し、失敗したパフォーマンス区間のみを再実行(全シーケンスの再生成ではなく)できるように支援します。モデルとモードを1つのホスト型ワークフローで使用したい場合は、MiniMax H3モデルページをご利用ください。あるいは、すでに強いポートレート(人物像)によって登場人物が明確に定義されている場合は、画像から動画へ(image-to-video)のワークスペースから始めます。クリエイティブな目標は常に同じです:物語を支えつつ、生成プロセスそのものに注目を向けさせない、わずかで意図的な表情の変化です。

結論

効果的なMiniMax H3の微表情(マイクロエクスプレッション)プロンプトは、内的な感情を短い可視化されたタイムラインへと翻訳します。すなわち、中立なベースライン、明確なトリガー、2~3つの互換性のある顔・身体のサイン、そして制御された静止状態です。カメラは十分に近づけ、各参照素材には1つの役割を割り当て、反応は再生順に台詞の周囲に配置し、誇張や矛盾した指示はすべて削除します。完成したクリップを音あり/音なしの両方で確認し、ショット間で承認された感情状態を記録し、1フレーズずつ修正を行ってください。参照素材の管理、タイミング調整、承認プロセス、および部分再実行が困難な課題となる場合、Seedance Agentを用いてパフォーマンスワークフローを構築することをお勧めします。そうすれば、注目の焦点は俳優の完成された瞬間に集中し続けます。

自分でも試してみますか?

このガイドの手順をSeedanceでそのまま試し、プロンプトや画像を数分で完成度の高い動画に変えましょう。

登録で無料クレジット。プランは月額$20から。