
Black Forest LabsはFLUX 3を発表した。これは、異なるメディアタイプごとに個別のモデルを学習するという業界慣行を放棄したマルチモーダル基盤モデルである。その代わりに、画像、動画、音声、ロボット動作シーケンスを単一の統合アーキテクチャ内で学習する。これは、単一のモダリティでは物理世界の振る舞いを完全に記述できないという前提に基づいている。
オープンウェイトのFLUX.1画像生成モデルで名を馳せたこのドイツ企業は、重要な戦略的転換を遂げている。FLUX 3はより大きな画像生成器ではなく、モデルが説得力のある波を描画できるのと同じ基盤表現が、ロボットが車のドアの取り付け方法を予測するのにも役立つという賭けなのである。
技術的基盤はSelf-Flowである。これは同研究所が今年初めに導入した学習手法で、フローマッチング目的と自己教師あり特徴再構成を組み合わせたものである。FLUX 3はこのアプローチを複数のモダリティに同時に拡張しており、同社は予備的な人間の嗜好評価結果として、このモデルが競合製品を総合的に上回っていると報告している。720p・10秒のテキスト・ツー・ビデオ・クリップ(音声付き)の直接比較では、評価者はFLUX 3をLuma Ray 3.2に対して93%、Runway Gen-4.5に対して77%、Grok Imagine Videoに対して69%のケースで優先した。
主力機能は、最大20秒の動画生成をネイティブの同期音声付きで1回のパスで行うことである。音声、効果音、環境音がすべて同時に生成され、後から重ねられることはない。このモデルは、テキスト・ツー・ビデオ、画像・ツー・ビデオ、キャラクターの一貫性を保ったビデオ・ツー・ビデオ、キーフレーム制御のトランジション、多言語ダイアログ、クリップをより長いマルチショットシーケンスにリンクできるエージェンティックチェーンをサポートする。Black Forest Labsは、人間の顔の表情や、音と物理的イベントを関連付ける能力において特に強みを発揮すると強調している。ガラスが割れる音がガラスらしく聞こえるのは、モデルが衝撃と音響特性の因果関係を学習したからである。
動画生成はモデルの学習計算量の95%以上を消費する。対照的に、音声はトークンの0.5%未満であり、視覚バックボーンが整えば音声モダリティがいかに低コストで追加できるかを示している。
FLUX-mimicと呼ばれるロボットコンポーネントは、FLUX 3の動画予測エンジンを再利用し、予測フレームをロボット動作シーケンスに変換する軽量デコーダを備えている。アウディはすでに、フレキシブルなドアシール取り付け用にこのシステムをテストしている。これは、開発チームによれば従来のプログラミングでは自動化が困難だったソフトボディ操作タスクである。FLUX-mimicは単一のRTX 5090上で約101ミリ秒で応答し、特定のタスクは最低30分のロボットデモデータで微調整できる。
Black Forest Labsはリリースを段階的に行っている。動画とアクション機能は現在、アーリーアクセスAPIと厳選されたパートナーへのプライベートウェイトアクセスを通じて利用可能である。画像合成と編集は今後数週間以内に提供される。オープンウェイト版のFLUX 3 Devは2026年後半に予定されており、研究所が最終的にモデルウェイトをコミュニティに公開するというパターンを継続している。
FLUX 3が送るより広範なシグナルは、単一のベンチマークスコアではなく、アーキテクチャの方向性に関するものである。画像、動画、音声、ロボット動作を1つのバックボーンに統合することで、Black Forest Labsは、汎用視覚知能への最も効率的なルートは各モダリティを個別に最適化することではなく、学習中に互いに制約し合うように強制することだと主張している。この統合アプローチが厳選されたデモの外でも通用するかどうかは、独立したベンチマークとオープンウェイトリリースが今年後半に登場したときに検証されるだろう。
ソース: FLUX 3 – Real World Models (Black Forest Labs、2026年7月23日); Black Forest Labs Unveils FLUX 3 (NYU Shanghai RITS、2026年7月24日); Black Forest Labs Releases FLUX 3 (MarkTechPost、2026年7月26日)
雅子 訳

