概要
- FLUX 3 はマルチモーダル基盤モデルとしてロボットに実装
- mimic robotics と協業しFLUX-mimicを開発、Audi工場で実運用
- ビデオ生成とロボット操作を同時に学習する単一バックボーン
- Self-Flow 手法で生成品質と表現品質を両立
- 実世界での迅速な応答と高効率な学習を実現
FLUX 3とFLUX-mimicの概要
- FLUX 3 は画像・ビデオ・音声を統合的に生成・理解するマルチモーダル基盤モデル
- FLUX 1, 2は画像生成に特化、FLUX 3は音声・映像を同時に扱う拡張
- mimic robotics はロボット学習・実装に強み、BFLは基盤モデル開発に特化
- 両者の協業によりFLUX-mimicを開発、Audiの工場で検証・展開
- FLUX-mimicは次世代のビデオアクションモデルとして汎用的な操作を実現
モデルの特長と学習戦略
- 動画生成 は学習コストの95%以上を占め、現実世界の物理法則理解が必須
- 動画の正確な生成には「接触」「運動」「重さ」「因果関係」などの習得が不可欠
- 音声やアクションは低次元表現であり、動画理解後は容易に学習可能
- アクション予測も既存の世界モデルの延長線上で実現
- 単一バックボーン で画像・動画・音声・アクションを統合的に処理
アクション予測の追加とパフォーマンス
- アクション予測追加時、一時的に動画生成品質が10%低下
- 3,500ステップで元の品質を回復し、アクション予測も同時に習得
- 既存能力を損なうことなく新しいモダリティを統合
- 物理AI としてマルチモーダル基盤モデルの自然な発展
FLUX-mimicの構造とデコーディング
- FLUX 3の中間特徴量を活用し、軽量なアクションデコーダを組み合わせ
- 世界モデルの「生成品質」と「表現品質」が成功の鍵
- Self-Flow 手法で生成と表現の両立を実現
- 自己教師あり学習でロボット制御タスクの成功率向上
スケーリングと産業応用
- FLUX 3は数千万時間の一般動画、数十万時間の人・ロボット操作動画で大規模学習
- mimicはFLUX-mimicを工場現場(部品キッティング、ECU挿入、組み立て、柔軟物操作等)に導入
- アクションデコーダは従来のVision-Language-Actionモデルを大幅に上回る性能
- Self-Flow とスケーリングにより少ないデータで高い学習効率
タスク適応と自己回復能力
- 世界モデルが物理法則を内部表現として保持
- 新タスクへの適応は「既知の知識を応用」するだけで済む
- デモデータが少なくても高い成功率、失敗時も自己修正可能
- ロボットが自律的に失敗から回復し、タスクを完遂
実運用での高速応答
- FLUX-mimicのバックボーンは80ms以下で世界表現を生成
- mimic独自の最適化で全体のリアクションタイムは101ms
- 少ないパラメータで高性能を維持し、実運用に適応
- センサー・モデル・アクチュエータ間の遅延も最小化
工場現場での価値
- Audiなど高度自動化工場の現場で従来自動化が困難だった領域に適用
- 柔軟物や複雑な組み立てなど、従来ロボットが扱えなかったタスクを実現
- FLUX-mimicによる「現実世界で使える物理AI」の実証