Black Forest Labsが、20秒のビデオクリップを同期音声とともに生成し、画像を処理し、ロボットの行動を予測できるマルチモーダルAIモデル「FLUX 3」をリリースしました。
そのモデルは7月23日に早期アクセスでリリースされ、BFLの初の真正に統合されたファウンデーションモデルです。FLUX 3は、画像、動画、音声、および物理的行動予測を単一のアーキテクチャ内で動作させます。
FLUX 3が実際に何をするか
メイン機能は、20秒までの動画を生成し、映像と同期したネイティブ音声を含むテキストから動画を生成する機能です。これにより、会話、効果音、環境音が画面の動作と正確に同期し、別途音声を生成して手動で編集する必要がなくなります。
BFLは、基盤となる技術を「Self-Flow」アプローチと呼び、この方式により、単一の統合システム内でマルチモーダルデータの整合性のある理解と生成が可能になります。
初期の評価によると、このモデルは他のモデルと比較して良好なパフォーマンスを発揮しています。初期のベンチマークによると、FLUX 3はRunway Gen-4.5などの競合モデルよりも77%のケースで選ばれました。
段階的な展開計画により、今後、ビデオ/オーディオ、画像、アクションの機能へのアクセスが拡大され、オープンウェイトの開発者版も計画されています。
ピクセルから生産ラインへ
BFLは、mimic roboticsと協力して、Audiの生産ラインで既に導入されているモデルの変種であるFLUX-mimicを開発しています。このシステムは、従来のロボットシステムにとって特に困難な、柔軟な素材の挿入や取り扱いなどの複雑なタスクを処理します。
BFLの推移とそれが投資家に意味するもの
FLUX 3は急速な開発サイクルに従っています。FLUX 1は2024年8月にリリースされ、FLUX 2は2025年11月にリリースされ、今回FLUX 3が約8か月後に登場しました。
財政的支援は野心に見合っています。BFLのシリーズB資金調達は3億ドルを調達し、企業価値は32億5千万ドルと評価されました。
注目すべき点の1つ:BFLは、FLUX製品ラインに任何の暗号トークンまたはデジタル資産も関連付けていません。名前が特定の暗号プロジェクトと類似しているものの、これは従来のベンチャーキャピタルによって資金提供されている純粋なAI企業です。

