Black Forest Labs のビジュアル創作向けマルチモーダルフロンティアモデルです。
テキストや画像からネイティブ音声付き動画を生成 — 720p または 1080p で最大 20 秒。
FLUX 3 は Black Forest Labs の新しいマルチモーダル基盤モデルで、FLUX および FLUX.2 画像ファミリーの次の世代です。静止画を独立したタスクとして扱うのではなく、FLUX 3 は統合アーキテクチャ内で画像、動画、音声を共同学習します。目標はより美しいフレームだけでなく、シーンの見え方、動きの展開、イベントの音の理解を深めることです。この共通バックボーンが静止画とショート動画の創作生成を支えます。Flux.art では FLUX 3 Video を今すぐ利用できます:テキストから動画、画像から動画、オプションのネイティブ音声、ドラフトプレビュー、最大 20 秒のクリップに対応しています。
FLUX 3 は画像、動画、音声信号を横断して学習する単一マルチモーダルシステムとして設計されています — 学習後に別々のモデルを組み合わせた構成ではありません。
シーンの見え方、動き、音を一体として学習することで、孤立したピクセルパターンではなく、構造、動き、視覚的因果関係を捉えます。
同一モデルファミリーが高品質な画像生成とオプション音声付きショート動画を対象とし、キャンペーン全体でルック&フィールの一貫性を保ちやすくします。
マーケティングビジュアルからソーシャルショート、ブランドストーリーテリングまで、研究デモだけでなく本番志向のクリエイティブ用途を想定しています。
FLUX 3 は「画像のみ」ジェネレーターから、時間的に連続したマルチモーダルなビジョンを扱うモデルへの転換を示します。毎週コンテンツを公開するチームにとって、この変化は品質、一貫性、ワークフロー設計に影響します。
画像・動画ワークフローで FLUX 3 を検討する際に知っておくべき主要機能です。
オプションのネイティブ音声付きで最大約 20 秒のショート動画クリップを生成します。豊かな表情、イベント連動サウンド、広告やソーシャルショート向けの多言語シナリオに対応します。
従来の FLUX バージョンより強化された複雑プロンプト追従と多言語テキストレンダリング、マーケティング・商品・デザインアセット向けの幅広いスタイル範囲で画像合成・編集に対応します。
画像、動画、音声を横断して学習する単一アーキテクチャ — 静止画とモーションがオブジェクト、照明、シーン構造のより一貫した理解を共有できるよう設計されています。
複雑なプロンプトと複数言語の高精度テキストに対応 — ポスター、UI モックアップ、パッケージ、多言語キャンペーンに不可欠です。
幅広い出力スタイルとアスペクト比をサポートし、フォーマットごとにモデルファミリーを切り替えずに、写真的、イラスト、ブランドルックを探索できます。
クリエイティブツール、メディア、デザイン、EC ストーリーテリングを想定 — FLUX.2 クラスの画像モデルで既に行っている作業を、ショート動画に拡張します。
具体的なクリエイティブ作業に FLUX 3 を当てはめ、キャンペーンとコンテンツロードマップを計画できます。
一括生成で一貫したモーションと音声が必要なコンセプトスポット、商品ティーザー、ソーシャルクリップに対応します。多言語表現サポートはグローバルキャンペーンに特に有用です。

FLUX 3 Image では FLUX.2 の強み — プロンプト追従、テキストレンダリング、編集可能な静止画 — の連続性が期待でき、マルチモーダル学習によりキャンペーンの静止画・モーションキット間の一貫性が向上します。
撮影全体を組み直すことなく、素材、照明、商品周辺のショートモーションを展示できます。ローンチティーザー、バリエーションテスト、ブランドルックに合ったライフスタイルシーンに有用です。
Flux.art で数ステップで FLUX 3 Video を生成できます。
AI 動画ジェネレーターに移動し、テキストから動画または画像から動画用に FLUX 3 を選択します。
5〜20 秒(または Auto)、720p/1080p、ネイティブ音声、高速プレビュー用のオプション Draft モードを選択します。
シーンを記述するか、最大 10 枚の参照画像をアップロード — 最初がクリップ開始、最後がクリップ終了になります。
ジョブを実行し、同期音声付き MP4 をプレビューしてからダウンロードするか、Draft モードで反復します。
FLUX 3 と FLUX.2 との比較に関するよくある質問です。