- ブログ
- AIビデオに複数ステップのアクションを実行させる方法
AIビデオは、通常1つの目に見えるアクションをうまく処理できますが、プロンプトで5つのアクションを要求するとストーリーを失ってしまいます。被写体がやかんを取る前にすでに注いでいたり、オブジェクトが各ステップの間に元の状態に戻ってしまったり、クリップ全体が開始ポーズに費やされてしまったりすることがあります。確実な解決策は、アイデアを観察可能な状態変化に変換し、各アクションに十分な画面上の時間を与え、1つのクリップでは明確に表現できない場合はシーケンスを分割することです。
本ガイドでは、プロンプトを脚本のように扱わず、AIビデオがマルチステップのアクションに正確に従うようにする方法を解説します。具体例として、バリスタが豆を計量し、お湯を注ぎ、ドリッパーを取り外し、完成したカップを提示する一連の動作を取り上げます。この手法は、組立手順のデモ、レシピ動画、製品の使用方法、クラフトチュートリアル、短いナラティブ・ビートなど、さまざまな用途に応用可能です。

AI Overview
アクションを順番通りに実行するAIビデオをどう作成すればよいですか?
各ステップを目に見える物理的なアクションとして記述し、その前後の状態を明確に定義し、明示的な順序語またはタイムスタンプでアクション同士をつなぎます。シーケンスは、クリップの再生時間内に収まるよう十分に短く保ってください。
マルチステップのアクションは1つのクリップで生成すべきですか?
2~3個の密接に連携したアクションで、余裕を持って収まる場合は1つのクリップで構いません。それより長く、繊細、あるいは状態変化を伴うシーケンスは、別々のショットに分割し、最後に受け入れられたフレームを次のショットへ引き継ぎます。
なぜモデルは中間のアクションを飛ばしてしまうのですか?
プロンプトに与えられた秒数に対してアクションが多すぎたり、中間の状態が視覚的に曖昧である可能性があります。そのステップには、具体的なオブジェクトとの相互作用、より長い時間、そして明確な結果を与えてください。
被写体とオブジェクトの一貫性をどう保てばよいですか?
参照画像、衣装、小道具、カメラ位置、照明、および開始状態を固定します。次のショットが直前のショットの終了地点から正確に始まらなければならない場合は、受け入れ済みの境界フレームを再利用します。
原子的なステップと状態を定義する
まず自然言語による目標を立て、それをカメラが捉えられるアクションに還元します。「コーヒーを作る」はアクション計画ではありません。「彼女が豆をグラインダーに注ぐ」がそうです。意図・感情・カメラ移動・複数のオブジェクト変化を1文に混在させないでください。各行には1人の実行者、1つの動詞、1つの対象物、1つの目に見える結果のみを含めます。
プロンプト作成前に、状態遷移ワークシートを作成してください:
| ステップ | 開始状態 | 目に見えるアクション | 終了状態 | 連続性のロック |
|---|---|---|---|---|
| 1 | スクープに豆あり;グラインダーは空 | バリスタが豆をグラインダーに注ぐ | スクープは空;豆はグラインダー内 | 同じエプロン、カウンター、カップ |
| 2 | やかんは持ち上げられている;ドリップ部分は乾燥している | バリスタがゆっくりと円を描くように注ぐ | コーヒー床が膨らむ(ブローミング) | 同じ手、やかん、カメラ |
| 3 | 注ぎ終了;ドリッパーはカレフェ上にある | バリスタがやかんを下ろし、ドリッパーを持ち上げる | 満たされたカップが準備完了 | 液面レベルおよび小道具の位置 |
| 4 | カップはカウンター上にある | バリスタがカップを前方に滑らせる | 完成したカップが提示される | 同じ照明と背景 |
終了状態はアクションと同等に重要です。それは、次のアクションが始まる際に何が維持されなければならないかをジェネレーターに伝えます。プレート、工具、衣類、製品などの向きが変化する場合は、その結果を明記してください。この disciplined approach は単純なtext-to-video workflowの品質向上にも寄与します。なぜなら、プロンプトが曖昧な意図ではなく、証拠となる具体的な描写を提供するからです。

利用可能な再生時間にアクションを合わせる
シーケンスが失敗するのは、そのアクション予算が時間予算を超過したときです。予備動作、実行、落ち着きのための時間を確保してください。注ぐ前に手がやかんに届く必要があります。また、やかんは置く前に止まらなければなりません。これらの遷移タイミングは短いですが、いわゆる「テレポート現象」を防ぎます。
5秒のクリップでは、1つの主要アクション、または2つのシンプルで密接に連携したアクションを目標とします。8~10秒では、カメラが安定し、オブジェクトが容易に識別できる場合、2~3個のアクションが可能になります。4つの明確なステップは、通常、複数のショットを必要とします。高速モンタージュのタイミングではより多くのイベントを表示できますが、それが1つの連続したアクションが完了したことを証明するものではありません。
シーケンスを簡略化した後にのみ、おおよその時間帯を割り当てます。例えば:0–2秒でやかんを持ち上げる、2–6秒でゆっくりと円を描くように注ぐ、6–8秒でやかんをカウンターに戻す、といった具合です。終了時には明確な静止状態を残してください。正確なタイムスタンプはあくまで指針であり、フレーム単位の編集コマンドではありません。そのため、数字ではなく、目に見える順序を評価してください。
再生時間が固定されている場合は、まず装飾的な動きを削除します。カメラの軌道運動、立ち上る蒸気、背景の来客、複雑な手の動きなどは、すべて動きの容量を競い合います。最初の成功した撮影ではカメラを固定し、アクションの順序が安定してから、控えめなズームインを追加してください。
順次実行アクションのプロンプトを作成する
安定したシーンを1度だけ記述し、その後に順序付きのアクション、さらにカメラおよび品質に関する制約を記述します。これにより、プロンプトの可読性が保たれ、長すぎるスタイルの前置きが本来のタスクを隠すことを防ぎます。
以下のコピー&ペースト可能なテンプレートをご利用ください:
[被写体および固定された外見] in [安定した環境]。
開始状態:[手・工具・オブジェクトの位置]。
まず、[1つの目に見えるアクションおよびその結果]。
次に、[1つの目に見えるアクションおよびその結果]。
最後に、[1つの目に見えるアクションおよび最終的な静止状態]。
これらのアクションは、自然な手の接触を伴い、オブジェクトのリセットなしで、この正確な順序で発生する。
[カメラの構図および動き]。[照明およびビジュアルスタイル]。
```コーヒーのショットについて:「オリーブ色のエプロンを着たバリスタが木製のカウンターバーの後ろに立っています。初期状態:彼女の右手はドライなコーヒーベッドの上にゴーゼネック・ケトルを保持しています。まず、彼女はゆっくりとした円を描くように注ぎ始めます。次に、コーヒーがブローム(膨らみ)し、彼女は制御された円運動を続けます。最後に、注ぎを止め、ケトルをカウンターに置きます。これらの動作は、この順序で正確に発生します。固定された中距離ショット、暖かみのある自然な窓からの光。」
肯定的な記述は、禁止事項の長リストよりも通常効果的です。「カップはカレフの左側に残る」と述べる方が、「カップを動かさない」とだけ言うより確実です。開始時の構図が重要である場合は、まず[image-to-video](/ja/image-to-video)から始め、すべての必須プロップがすでに含まれているリファレンスを選択してください。
## 1つのショットで生成するか、クリップに分割するか
同一被写体が単一の場所で連続した動作を行い、カメラがそのすべての結果を観察できる場合、1つのショットで生成します。物体が変形する、被写体の位置が変わる、新しいツールが登場する、あるいはあるステップが繰り返し消える場合には、シーケンスを分割します。
実用的な判断基準はシンプルです:このシーケンスを「3つの動詞+1つの安定した初期画像」で説明できないなら、複数のショットを使用してください。ショット1はケトルがカウンターに静止した時点で終了できます。ショット2はその受け入れ済みの終了フレームから始まり、ドリッパーを取り外す様子を示します。これにより、各生成タスクの負荷が軽減されながら、一連のワークフローとしての見た目は維持されます。
過負荷のプロンプトを何度も再試行しないでください。同じ欠落ステップで2~3回失敗した後は、単位を短縮してください。ツールが明示的な視覚的なウェイポイントをサポートしている場合、[Pikaのマルチキーフレームチュートリアル](/ja/blog/pika-multiple-keyframe-video-tutorial)が役立ちます。より広範なアイデンティティおよび環境制御には、[AIビデオの一貫性ガイド](/ja/blog/best-ai-video-generator-for-consistency)の手法をご活用ください。

## ステップ間の連続性を維持する
クリップ間の境界は、マルチステップのワークフローがしばしば崩れる箇所です。手やプロップ、被写体が中立的かつ読み取り可能な状態になった後にのみ、最終フレームを保存してください。モーションブラーがかかるフレーム、半分隠れたツール、または物体を横切る指のフレームでは、次の生成に不確かな幾何学情報が与えられてしまいます。
次のショットへと5つの「ロック」を引き継いでください:被写体のアイデンティティ、衣装、主役となるオブジェクト、環境、カメラの方向。また、変化を許容する変数も明記してください。コーヒーの例では、液体のレベルは上昇しても構いませんが、カップのデザイン、エプロン、カウンタートップ、光源の方向は固定しなければなりません。
境界フレームを用いる場合、前の全動作を繰り返すのではなく、それを「初期状態」として記述してください。次のプロンプトはこうすべきです:「ケトルはカウンターの右側に静止しており、満たされたドリッパーはカレフの上にそのまま残っています。バリスタはドリッパーを真上に持ち上げます。」注ぎの動作を再現すると、モデルがそれを最初からやり直す可能性があります。
この実際の Seedance の例は、接触、カメラの安定性、および落ち着き具合を評価するための独立したモーション参照として収録されています。これは、この特定のコーヒーのシーケンスが1パスで生成されたという証拠ではありません。
```official-video
src=https://r2.seedance.tv/blog/runway-failed-generation-credits-refund/seedance-coffee-motion-control-v1.mp4
poster=https://r2.seedance.tv/blog/runway-failed-generation-credits-refund/seedance-coffee-motion-control-poster-v1.jpg
label=Seedance motion-control reference for action review
シーケンスのレビューと修復
まず通常速度で再生して確認してください。各動作が正しい順序で発生し、それぞれが要求される状態を生み出しているかを確認します。その後、手の接触点およびショットの境界付近をフレーム単位で検査します。蓋が手に触れる前に開いたり、満たされた容器が空になったりすれば、美しい映像でも失敗です。
簡潔な承認チェックリストをご活用ください:
- 必須の各動作が1度ずつ、かつ正しい順序で出現している。
- 開始状態および終了状態が視覚的に明瞭に読み取れる。
- 手が意図したオブジェクトに接触し、融合したり左右が入れ替わったりしていない。
- プロップが消失・複製・リセット・デザイン変更していない。
- カメラの方向および被写体の画面内位置が一貫している。
- 最終フレームがクリーンなハンドオフまたは編集ポイントとして機能できる。
最も小さな不具合単位を修復してください。ステップ2が欠落している場合は、より多くの時間を割り当てたり、新しいショットとして隔離したりしてください。アイデンティティがブレる場合は、リファレンスを強化し、カメラの動きを抑制してください。オブジェクトが変形する場合は、より明確な境界フレームを選択し、その幾何学的状態を再記述してください。編集が唐突に感じられる場合は、全体を再生成する代わりに、0.5秒の落ち着きポーズを追加してください。
Seedance Agent は、複数の生成が必要な作業において有用です:ステート・ワークシート、リファレンス、ショット順序、レビュー備考、対象を絞った再試行を一元管理できます。これにより、承認の判断基準が「魅力的なクリップが『なんとなく合う』かどうか」ではなく、観測可能な遷移に集中できるようになります。

結論
AIビデオにマルチステップの動作を正確に従わせるには、アイデアを原子的な動詞に分解し、すべての開始・終了状態を定義し、各動作をクリップ長に対して予算配分し、過負荷になる前にシーケンスを分割します。クリーンな境界フレーム、安定した視覚的ロック、そして「スタイル」だけでなく「順序」を検証するレビュー・チェックリストによって、連続性を保ちます。計画・生成・比較・修復を伴う長いアクション・チェーンを準備する際は、Seedance Agentでワークフローを構築してください。
自分でも試してみますか?
このガイドの手順をSeedanceでそのまま試し、プロンプトや画像を数分で完成度の高い動画に変えましょう。
登録で無料クレジット。プランは月額$28から。
関連記事
同じ言語で次に読みたい記事です。

Pictory でテキストを使って動画を編集:文字起こしから録音をカット
録音を Pictory にアップロードし、その文字起こしを確認して、不要なテキストを削除することで動画をカットします。ジャンプカットと字幕を修正し、Bロールを追加して、クリーンな最終版をエクスポートします。
記事を読む
ElevenLabs Voice Changer 動画チュートリアル:声を置き換え、パフォーマンスを維持する
ElevenLabs Voice Changer を使用して動画の台詞を変換し、感情とタイミングを保持し、リップシンクを復元し、アーティファクトのトラブルシューティングを行い、一貫性のあるミックスを仕上げます。
記事を読む
Runway Aleph Green Screen:キー可能な被写体とクリーンプレートの作成
Runway Aleph 2.0 を使用して通常の映像をグリーンスクリーン用アセットに変換し、正確なプロンプトを作成、結果をキーリング(クロマキー)処理し、エッジの問題を修正してクリーンプレートを作成します。
記事を読む