ComfyUI クラウド動画ワークフロー:人物、モーション、オクルージョンの制御

E
Emma Chen·読む時間: 約1分·Sep 13, 2026
Xで共有
ComfyUI クラウド動画ワークフロー:人物、モーション、オクルージョンの制御

AI 概要

クラウド動画向けに最も安全な ComfyUI ワークフローとは?

まず、承認済みのクラウド静止画を 1 枚作成し、主役(リード)を背景グループから分離します。その後、深度またはポーズによるガイダンスを追加して短いショットを生成します。人物の同一性、通行路(レーン)、および被り(オクルージョン)が安定したことを確認した後で、ようやくクラウドの動きを増加させます。

ComfyUI で複数の人物を一貫性を持って維持するには?

すべての重要な人物に、固有の役割、衣装のアンカー、画面内のゾーン、および行動を割り当てます。優先度の高いキャラクターには参照画像/動画を用い、カメラ移動はシンプルに保ち、交換や重複が発生していないかを確認するために、完成したクリップ全体をレビューします。

AI クラウド動画で体が融合したり、余分な人物が出現するのはなぜですか?

クラウドは、多数の重なり合う被写体、高速な動き、小さな顔、そして不確かな深度を含むため、非常に複雑です。プロンプトでレイヤーやパスが明示されていない場合、モデルは被り(オクルージョン)を新たな身体やアイデンティティとして再解釈してしまうことがあります。

クラウドシーンは一度の生成で完了させるべきですか?

単純で、わずかに動く背景のみの場合は、一度の生成で十分です。しかし、より密度の高いアクションを含む場合は、まずヒーロー(主役)レイヤーを生成・承認し、次にクラウドを第 2 のレイヤーとして制御し、最後に合成するか、あるいは失敗した最小限の領域のみを再実行します。

クラウドシーンがソロショットよりも容易に崩れる理由

ソロの「画像→動画」ショットでは、モデルに求められるのは、1 つのアイデンティティ、1 つの身体、1 つの主要な動作の維持だけです。一方、クラウドショットでは、これらの要求が倍増するだけでなく、さらに人物同士の交差(インターセクション)も加わります。ある人物が主役の後ろを横切ったり、別の人物がフレーム外へ退出したり、2 本の腕が重なったり、いくつかの小さな顔が圧縮を通して動いたりします。モデルは、すべてのフレームにおいて、各ピクセルが誰に属するかを判断しなければなりません。そのため、説得力のあるポスターフレームであっても、実用不可能なクリップになってしまうのです。

実用的な目標は「多くの人物を生成すること」ではなく、「読み取り可能な階層構造を維持すること」です。視聴者が認識すべき人物、物語上のアクションを遂行する人物、そして単に雰囲気を提供する人物を明確に決定してください。主役には最も強力な参照と最大の画面領域を割り当てます。特筆すべきエキストラ(追加出演者)は、名前付きの役割として扱います。残りのクラウドは、20 人もの個別に詳細に記述された見知らぬ人々ではなく、共通の方向・速度・深度を持つグループとして扱います。

映画のリハーサルでは、主役、監督、背景のパフォーマーが読み取りやすい深度レイヤーに分離されています

前景の主役、中景の指示役、背景の歩行者を、均質化された単一のクラウドではなく、それぞれ独立した制御課題として検討してください。

まず、簡潔な受入契約(acceptance contract)から始めましょう:主役の顔は認識可能である;身体の重複は発生しない;前景の通行路は衝突しない;特筆すべき衣装の色は割り当てられたまま維持される;登場・退場はそれぞれ 1 回のみ;背景が注目を奪わない。これにより、「クラウドが変に見える」という曖昧な評価を、特定・再実行可能な具体的な失敗事象へと変換できます。

グラフを開く前に「役割とゾーン」の計画を設計する

アイデンティティの優先順位を割り当てる

3 段階の優先度を使用します。Priority A は主役またはスピーカーであり、最も明瞭な画像または参照動画を受け取ります。Priority B には、衣装と動作が重要な 1~3 名の特筆すべきエキストラが含まれます。Priority C は雰囲気を提供する存在であり、シルエット、着席中の来場者、通勤者、遠方の歩行者などです。全員に等しく条件付けの強度を割り当ててはいけません。競合する参照が多すぎると、むしろ明瞭さが低下します。

プロンプト作成の前に、簡潔なマニフェストを作成してください:

役割 画面ゾーン 視覚的アンカー 動作 必ず維持すべきこと
主役(Lead) 前景左~中央 ラスト色コート、黒いバッグ カメラに向かって歩く 顔とコートは安定している
エキストラ A(Extra A) 後景左 ネイビーのキャップ 左から右へ横断 主役の後ろを 1 度だけ通過する
グループ B(Group B) 遠方のプラットフォーム 暗めのオフィス風服装 ゆっくりと乗り込む 背景スケールを維持する

この表は制作管理のためのツールであり、そのまま貼り付けるテキストではありません。モデルに推測を任せる前に、矛盾を自ら解決するよう強制します。後続のショットでも同じキャストを継続して使用する必要がある場合は、マルチキーフレームワークワークフロー を参照し、視覚的アンカーの承認と再利用方法を確認してください。

深度と交通レーンをブロックする

ショットを前景、中景、背景のゾーンに分けてスケッチします。異なる方向を持つ 2~3 の動きのレーンを定義します。最初のテストでは、複数の全身が同じ中心点を通過するような設定を避けてください。全方位に無制限に流れるクラウドよりも、左右への横断の方が判断しやすくなります。静止または穏やかにトラッキングするカメラは、身体の動きやアイデンティティ維持に、より多くの処理余力を残します。

ラスト色コートの通勤者が視覚的優先度を保つ一方で、背景の歩行者は異なる深度で横断しています

一部の人物が前面を通り、他の人物が背面を通過する被り(オクルージョン)テストを行い、各身体がきれいに退出するか(融合せずに)を確認します。

ComfyUI クラウド動画ワークフローを構築する

1. コンポジション静止画を承認する

最終的なカメラ高さ、クラウド密度、衣装の割り当て、開放された動きのレーンを含む、クリーンな 16:9 または 9:16 の画像を生成または提供します。アニメーション開始前に、重複した顔、ありえない手、交差する足などを修正します。画像→動画変換は、承認済みのフレームをアニメーション化することはできますが、壊れたクラウドレイアウトを修復することまでは期待できません。直接ホストされたテストを行う場合、Seedance の画像→動画ルート を利用すると、ローカルグラフを維持せずとも、同一のソースを評価できます。

2. ショットに必要な制御のみを抽出する

予想される失敗に応じて、ガイダンスを選択します。深度は前景から背景への順序維持に役立ちます。ポーズは特筆すべき動作をサポートします。エッジは建築物や大型プロップを保護します。セグメンテーションまたはマスクは、主役を雰囲気的なグループから分離するのに有効です。シーンの可読性を保つために、最も軽量な制御の組み合わせを用いてください。すべてのプレプロセッサを高強度で重ねると、動きが硬直化したり、制御間で矛盾が生じたりする可能性があります。参照動画を移動させる場合、カメラとボディのリズムが類似したクリーンなセクションを切り出してください。抽出前に解像度とフレームレートを正規化します。通行人が交差する際にポーズ追跡が隣接する人物間でジャンプしないことを確認してください。たとえポジティブプロンプトをどれほど注意深く記述しても、スケルトンが入れ替われば動きも入れ替わってしまいます。

3. 主役の動きと群衆の動きを分離する

主役とごく少数のエクストラのみを含むベースラインを構築します。シード値、モデル、サンプラ、画像サイズ、フレーム数、カメラ指示はすべて固定します。主役の動きが問題なく生成されたら、雰囲気を高める群衆や、第2の条件付けブランチを追加します。ワークフローがマスキングまたは合成をサポートしている場合は、主役と背景の出力を十分に独立させ、片方だけを修正できるように長期間維持してください。

駅構内で歩行者が交差する動く被写体

この既存のSeedanceライブラリクリップは検査用の例であり、制御されたComfyUIベンチマークではありません。全体の動きを通して、主役のボディ、通過する歩行者、コートの端、足、および遮蔽状態を観察してください。

4. グラフと由来情報を保存する

ワークフローのJSON、モデルファイル名、カスタムノードのバージョン、入力ハッシュ、シード値、画像サイズ、フレーム数、FPS、コントロール強度、および承認済み出力のすべてを一緒に保存してください。ComfyUIは変更されたグラフ領域のみを再実行できますが、承認済み設定が記録されていないと、この利点は失われます。レンダリング後にキュー実行が停止した場合は、創造的なコントロールを変更する前に、ComfyUIフリーズ回復ガイド を参照してください。

混乱を招かずに複数人物をプロンプトする方法

プロンプトはショット順(シーン設定 → 優先被写体 → 特徴的なエクストラ → 群衆グループ → カメラ → 除外事項)で記述します。重要な人物は一度だけ名前を付け、その記述子は一貫して維持します。背景にいる人物は集団として記述します。「6人の通勤客が暗いコートを着て開いた車両に向かって移動する」は、無関係な顔・年齢・装飾品を延々と並べるよりも明確です。

有用なテンプレート例:

雨の降る広いホーム、アイレベルのカメラ。錆色のコートを着た女性が左前方から中央へ向かって歩き、まっすぐ前方を見つめている。紺色のキャップをかぶった男性が彼女の後方を左から右へ横切る。遠方のグループは静止した列車にゆっくりと乗り込む。穏やかな前方へのカメラトラッキング;自然な歩行ペース;前景の顔は安定;重複する人物なし;衝突なし;突然の登場なし。

可視化可能な失敗クラスに対してのみネガティブ指示を用います。想像できるあらゆるオブジェクトに対してネガティブ指示を書く必要はありません。「重複するボディ、融合した四肢、顔の入れ替え、テレポートする歩行者、逆方向への歩行、前景への新規人物の進入」は実行可能な指示です。顔の品質低下が被写体が小さくなったときにのみ発生する場合、距離による顔修復ガイド を参照すると、グローバルなガイド強化を強制する代わりに、専門的な診断が得られます。

6人のダンサーがそれぞれ別々のレーンを占め、一方で一般の歩行者は遠方の背景に留まっている

振付テストでは、背景の交通流が従属的であることを保ちつつ、個別のボディとジェスチャーが明確に保たれる必要があります。

小規模なストレスラダーで群衆の一貫性をテストする

最終的なフェスティバル、戦闘、コンサートからいきなり始めないでください。4段階のラダーを使用します。第一段階:交差のない3人のアニメーション。第二段階:1人のエクストラが主役の後方を横切る。第三段階:1つの前景での遮蔽を導入。第四段階:遠方の大気的なグループを追加。再生時間を短く保ち、密度を増す前に各段階を確認してください。

通常速度およびフレーム単位で出力を評価します:

  • 同一性:優先される顔、髪型、衣装が割り当てられたまま維持される。
  • 人数:新しい前景人物が出現せず、必要な人物が早期に消滅しない。
  • 解剖学的正確性:重なりの前後で四肢が正しく分離される。
  • 交通流:すべての進入・交差・退出が指定されたレーンに従う。
  • 奥行き:遠方の人物は小さいままであり、前景へジャンプしない。
  • カメラ:カメラの動きによって全群がスライドしたり「呼吸」したりしない。
  • 時間的完成度:最終フレームがカットまたは延長可能なほど安定している。

ルール違反が最初に発生するフレームを記録してください。その時点は、原因が不適切な初期レイアウト、ポーズ追跡の入れ替え、過剰な動き、弱い同一性条件付け、あるいは群衆と競合するカメラ動きのいずれかを明らかにする手がかりとなることが多いです。

全体シーンを再構築せずに失敗を修正する

ボディが融合する場合:開始時の間隔を広げ、交差パスを簡素化し、奥行きまたはマスクによる分離を強化し、ショットを短縮します。主役の同一性が不安定になる場合:プロンプト内の群衆の詳細を減らし、優先参照の影響力を高めます(すべてのコントロールを一律に強化するのではなく)。背景が凍結する場合:1つの集団的アクションと穏やかな動きを追加します(遠方の各人物に個別のパフォーマンスを割り当てる必要はありません)。

動きがジャッターする場合:ポーズまたは光学的ガイドをフレーム単位で検査します。単一の不良トラックを滑らかにし、終盤近くのコントロール強度を下げたり、競合するコンディショナーを削除します。人物が画面端から突然現れる場合:画面端に近いボディの数を減らし、進入を明示的に指定します。各実験には成功したベースライングラフを併置し、ノード更新によって最後に確認済みの良好な設定が失われないようにします。

忙しい食品市場は、買い物客一人ひとりを特筆すべきキャラクターにすることなく、多くの奥行き層を提供しています

密度の高い雰囲気を実現する際は、まず奥行き順序、クリーンなシルエット、そして信頼できる交通流を評価し、その後で背景人物の個別パフォーマンスを要求してください。

多数のバリエーションを作成する場合、クリエイティブな生成とファイルのオーケストレーションを分離します。ComfyUIバッチ処理ガイド では、決定論的なフォルダ構成、マニフェスト、再試行について説明しています。本群衆ワークフローでは、まず1つの承認済みショットを生成し、それをバッチ処理の対象とするべきです。

Seedance Agentがよりシンプルな制作ルートとなる場合ローカルの ComfyUI グラフは、正確な前処理(preprocessor)、カスタムマスク、モデルレベルの制御、あるいは再現可能な実験が必要な場合に価値があります。ただし、その代わりに、参照元の管理、ノードのバージョン管理、キュー状態の監視、出力結果のレビュー、および部分的な再実行を自ら責任を持って行う必要があります。群衆シーンではこの協調作業がさらに重要になります。なぜなら、1人の追加キャラクター(extra)が却下された場合でも、それ以外は優れた出来だったとしても、全体として無効と判断されてしまう可能性があるからです。

Seedance Agent は、グラフの所有権よりも制作タスクそのものが重視される場合に有用です。出演者(cast)の優先順位、参照用アセット、ショット一覧(shot manifest)、群衆の通行レーン(crowd lanes)、再生時間、アスペクト比、および承認基準を指定してください。生成開始前に提案されたショット計画をレビューし、最も優れた結果を承認し、失敗した単位(unit)のみを再実行します。このアプローチの利点は、「すべての群衆が完璧になる」という保証ではありません。むしろ、計画・生成・レビュー・納品という各フェーズの境界を明確にすることにあります。

結論

信頼性の高い ComfyUI 群衆動画ワークフローは、まず承認済みの構成(composition)から始め、アイデンティティの優先順位を割り当て、奥行きゾーンと交通レーンを分離し、必要最小限の制御のみを適用し、測定されたストレス階段(stress ladder)によって密度を段階的に増加させます。フルクリップを、アイデンティティ、人数、解剖学的正確性、被覆(occlusion)、動き、および実用可能な終了フレームの観点から評価し、すべてを最初からやり直すのではなく、最も小さな失敗レイヤーのみを修復します。参照元、マスク、ノードのバージョン、レビュー、再実行の管理が、作業全体の中で最も大きな負担となる場合、Seedance Agent を用いて群衆シーケンスの計画と制作を行ってください。一方で、ローカル制御による恩恵が明確に得られるショットについては、引き続き ComfyUI を活用します。

自分でも試してみますか?

このガイドの手順をSeedanceでそのまま試し、プロンプトや画像を数分で完成度の高い動画に変えましょう。

登録で無料クレジット。プランは月額$20から。