概要
- FLUX 3 は画像・動画・音声を統合的に学習する 新しいマルチモーダル基盤モデル
- テキスト、画像、動画、音声を 組み合わせて生成・理解 可能
- 初期評価 で他の先進モデルより高い評価を獲得
- 画像・動画生成、アクション予測など 多様な機能 を段階的に提供予定
- 物理AIやコンテンツ制作など 幅広い応用分野 を想定
FLUX 3とは何か
- FLUX 3 は画像、動画、音声を 統合的に学習 するマルチモーダル基盤モデル
- Self-Flow アプローチに基づき、効率的なマルチモーダル生成と理解を実現
- 画像・動画・音声を 同時に学習 し、それぞれの特徴を相互に補完
- 一つのモダリティだけでなく、 複数モダリティの同時学習 で現実世界の本質的な表現を獲得
- 物体の構造、動き、音の因果関係など、 現実世界の理解 を目指す
モデルの主な特徴
- テキスト・画像・動画・音声 の生成・編集に対応
- テキストから動画や画像、画像から動画、動画から動画など 多様な生成パターン をサポート
- テキストtoビデオ、画像toビデオ、動画to動画、動画+音声の連続生成など
- 20秒までの動画生成、ネイティブな音声合成、複数言語対応
- スタイルの多様性 (カメラ映像からアニメーション、シネマティックまで幅広く対応)
- 一貫性のあるキャラクター表現 や、物理イベントと音の関連付けに強み
- タイポグラフィ生成 やアニメーションデザインも得意
性能評価と他モデルとの比較
- 初期評価で Grok Imagine Video(69%)、Kling v3 Pro(60%)、Happy Horse v1(59%)、Runway Gen-4.5(77%)、Luma Ray 3.2(93%) など他の先進モデルより高い支持率
- 人の表情表現、物理イベントと音の関連付け、多言語対応 で特に高評価
- 生成結果は初期段階ながら、 今後さらなる改善 を予定
画像生成・編集機能
- 多様なスタイルやアスペクト比、解像度 で画像を生成・編集可能
- 複雑なプロンプトや多言語テキスト生成の対応力が 従来モデルより大幅向上
- 画像生成機能も 早期アクセス段階 で順次公開予定
アクション予測とロボティクス応用
- アクション予測機能 をFLUX 3本体に統合
- mimic robotics との連携で、ロボットの巧緻動作や生産現場での実用化を目指す
- FLUX-mimic として、動的環境でのアクション予測モデルを開発
今後の展開と提供計画
- 動画・音声生成/編集API、 アクション予測API、 画像生成API、 マルチモーダル基盤モデルのオープンウェイト提供 を順次開始
- FLUX 3 Video、FLUX-mimic & FLUX 3 Action、FLUX 3 Image、FLUX 3 Devとして展開
- 早期アクセス を通じてフィードバック収集と安全性検証を実施
- 技術的詳細も 今後公開予定
今後のビジョンと募集
- インタラクティブな画像・動画編集、シミュレーション、物理AI など多様な応用を想定
- 知覚・行動・言語予測の統合モデル の開発を目指す
- ドイツ・米国で採用活動中、開発や実証実験への参加を呼びかけ
FLUX 3 は、現実世界の多様な情報を統合的に学習・活用することで、次世代の知覚・生成AIの基盤となることを目指しています。