Black Forest LabsがマルチモーダルAIモデル「FLUX 3」を発表、Early Accessで提供開始
Black Forest Labsは、画像・動画・音声を統一アーキテクチャで学習する新しいマルチモーダル基盤モデル「FLUX 3」をEarly Accessで公開した。最大20秒の音声付き動画生成や画像合成編集、物理AI向けのアクション予測が可能。
Black Forest Labsは2026年7月23日、マルチモーダル基盤モデル「FLUX 3」をEarly Accessで提供開始した。同社は「FLUX 3」について、「画像、動画、音声を統一アーキテクチャ内で共同学習する新しいマルチモーダル基盤モデル」と述べ、物体がどのように保たれるか、物の動き方、事象がどう音で表現されるかを学習する必要があると説明している。
主な機能と性能
FLUX 3は20秒までの音声付き動画を単一の生成で作成でき、テキストから動画への生成、画像から動画への生成、動画から動画への生成、生成的な動画音声継続、キーフレームから動画への生成、多言語対話、およびクリップの連鎖的なチェーニングに対応する。また、様々なスタイル、アスペクト比、解像度での画像合成と編集も可能である。
予備的な評価結果では、720p解像度の10秒テキスト動画クリップを用いた比較において、FLUX 3はGrok Imagine Videoに対して69%、Kling v3 Proに対して60%、Happy Horse v1に対して59%、Happy Horse 1.1に対して57%、Seedance 2.0およびGemini Omni Flashに対して52%、Runway Gen-4.5に対して77%、Luma Ray 3.2に対して93%の割合で選好されたとされる。
パートナーシップと応用例
mimic roboticsおよびAudiがFLUX 3への早期アクセスを獲得した初期パートナーとなった。mimic roboticsはFLUX 3のバックボーンとロボット学習における同社の専門知識を組み合わせた動画アクションモデル「FLUX-mimic」を開発している。
FLUX 3は人間の顔の表情、音と物理的事象の関連付け、多言語能力において特に強みがあるとされている。アクション予測機能は、ネイティブ統合および物理AI向けアクション予測用の事前学習済み動画バックボーンを通じたファインチューニングの両方で提供される。
筆者の見立て
- 「モデルは世界の表現を学ぶ必要があり、単一のモダリティは完全な説明を提供しない」と解釈している
- 「早期結果はコンテンツ作成と物理AIにおいて、これが正しい道であることを示唆している」と予想している
- 「インタラクティブな画像・動画編集、シミュレーションからコンピュータ使用と物理AIまで、フロンティアは広く開かれている」と示唆している
- 「知覚、アクション、言語予測を同じ統一モデルに統合することが目標」と述べている
この記事は元記事の事実のみに基づいて自動生成されました。
出典
Black Forest Labs、「FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence」、https://bfl.ai/blog/flux-3