FLUX 3 Video レビュー:マルチモーダルなパワーや 20 秒間のクリップ、そして正直な限界点

E
Emma Chen·読む時間: 約2分·Aug 19, 2026
Xで共有
FLUX 3 Video レビュー:マルチモーダルなパワーや 20 秒間のクリップ、そして正直な限界点

AI 概要

FLUX 3 Video とは何か、また誰が開発したのか?

FLUX 3 Video は、Black Forest Labs が開発した、動画・音声・画像・アクションを統合的に扱うマルチモーダルモデルです。2026 年 7 月に発表されたこの動画機能では、テキストから動画や画像から動画へと最大 20 秒間のクリップを生成でき、ネイティブ音声も付与されます。

FLUX 3 Video の品質は、他のモデルと比べてどの程度優れているか?

FLUX 3 は、アニメーション付きタイポグラフィ、幅広いビジュアルスタイル、対話シーン、および自然なシンプルなシーン表現において特に優れています。一方、ホスティング環境下での 2K 出力、複雑な物理挙動、長時間にわたるオブジェクトの一貫性などについては、MiniMax H3 の方がより信頼性が高い選択肢です。

FLUX 3 Video の料金はいくらか?

パートナー API の価格は、約 1 秒あたり $0.17(10 秒で約 $1.70)です。Black Forest Labs は、一般向けの単純な「1 秒あたり」の料金体系を公表していません。そのため、一括処理を実行する前に、現在有効なプロバイダーの料金を必ずご確認ください。

自分でも試してみますか?

登録で無料クレジット。プランは月額$20から。

無料でSeedanceを試す

FLUX 3 Video を ComfyUI 上でローカル実行できるか?

現時点では、公式に提供される消費者向けダウンロード可能な重み(weights)を用いたローカル実行はできません。ホスティングされた API ワークフローは ComfyUI や Comfy Cloud 上で利用可能になる可能性がありますが、ローカルでのセルフホスティングは、計画中の FLUX 3 Dev オープンウェイト版のリリースに依存しており、そのリリース日は未定です。

FLUX 3 Video が「実際に」何であるか — すべてを包括する 1 つのモデル

FLUX 3 は、動画専用のチェックポイントに後付けで別個の音声・音響ツールを接続したものではありません。これは、画像・動画・音声・アクションを、1 つのアーキテクチャで統合的に学習したマルチモーダル基盤モデルです。「Self-Flow」アプローチにより、これらのモダリティ(情報形式)が相互に整合され、生成された視覚的インパクトが音響に影響を与えたり、発話内容が口の動きを制御したり、画像参照が後の動画フレームをガイドしたりすることが可能になります。

この設計こそが、本製品の最も重要な強みです。クリエイターは、テキスト、開始画像、キーフレーム、既存の映像、対話、環境音などを、それぞれ独立したタスクとして扱わず、シームレスに切り替えて作業できます。ただし、この広範な基盤モデルには、同様に重要なトレードオフも存在します。すなわち、汎用性の高い基盤モデルが、あらゆるモーション、解像度、一貫性に関するテストで、専用の動画モデルを自動的に上回るわけではありません。

上記の公式生成フレームは、FLUX 3 の視覚的表現力の優れた例です。光沢のある赤いコートを着た人物が、蛍光グリーンのランドリー内に立っています。中央に配置された被写体、繰り返し配置された円形の洗濯機、そして鮮烈な補色対比が、視認性を損なわず、即座にグラフィック的なインパクトを与える構成となっています。

FLUX 3 Video が「実際に」できること — 機能と仕様

現行の生成リリースでは、基本的なテキストから動画への変換よりも広範な制御セットが提供されています:

  • 最大 20 秒間: 5 秒または 10 秒で終了してしまうのではなく、1 回の生成で完全な対話シーンや短い CM シーンを収めることができます。
  • ネイティブ音声: 対話、効果音、環境音がフレームと同時に生成されるため、別途ボイスオーバーを追加する必要はありません。
  • テキスト・画像・キーフレーム入力: プロンプトから開始するほか、初期画像をアニメーション化したり、終了画像を定義したり、複数のキーフレームを連結したりできます。
  • 動画の継続生成: 最大 4 秒間の既存動画と音声を入力し、その継ぎ目を超えてモーション、カメラ動作、対話、音響を継続的に生成できます。
  • 複数ショット: 1 回の生成内でシーンやカメラ角度を切り替えつつ、全体として関連性のあるシークエンスを維持できます。
  • タイポグラフィ: タイトル、看板、画面グラフィックス、アニメーション文字などのテキストを、シーンの一部として直接レンダリングできます。
  • スタイルの多様性: カムコーダー風のカジュアルな映像からアニメーション、広告、ノスタルジア、洗練されたシネマまで、幅広いスタイルに対応します。
  • 解像度: 生成は HD で提供され、フル HD 出力はアップスケーリングによって得られます。ただし、1080p はネイティブの 2K レンダリングとは混同しないでください。

公式 FLUX 3 キーフレーム補間デモ(赤いおもちゃのボート)

公式 FLUX 3 出力:3 つの指定キーフレームを 10 秒間のシークエンスに連結した例。タイムライン表示により、孤立した最終フレームを見るよりも、制御方法が直感的に理解しやすくなっています。

公式 FLUX 3 出力 · ネイティブ音声付きアニメーションタイポグラフィ

このタイポグラフィの例は、実際の生成クリップであり、デザインされたモックアップではありません。本番用モデルを選択する前に類似コンセプトを検証するには、まず Seedance のテキストから動画へのワークフロー を試し、同じ依頼内容、再生時間、アスペクト比を用いてください。

実世界における品質 — FLUX 3 が優れている点と、課題となる点

FLUX 3 が最も明確に優れているのは、動きの中でのグラフィックコンテンツの表現です。端末上のテキスト、タイトルカード、看板、デザインされた文字などは、多くの動画モデルが生成する曖昧で読み取りにくい文字と比べ、意図が明確に伝わるものです。また、カジュアルなスタイル、レトロ調、アニメーション、商業用スタイルなど、さまざまなスタイルをスムーズに切り替えて表現できます。対話シーンでは、音声と動画を統合的に扱うモデルの恩恵を受け、発話、表情、部屋の残響音などが一体となって計画されます。

公式 FLUX 3 出力 · ネイティブ音声付き 20 秒間の対話シーン

自分でも試してみますか?

このガイドの手順をSeedanceでそのまま試し、プロンプトや画像を数分で完成度の高い動画に変えましょう。

登録で無料クレジット。プランは月額$20から。