世界を動かす技術を、日本語で。

Flux 3 X Mimic: 次世代のビデオアクションモデル

2026年7月24日原文(bfl.ai)

概要

  • FLUX 3 はマルチモーダル基盤モデルとしてロボットに実装
  • mimic robotics と協業しFLUX-mimicを開発、Audi工場で実運用
  • ビデオ生成とロボット操作を同時に学習する単一バックボーン
  • Self-Flow 手法で生成品質と表現品質を両立
  • 実世界での迅速な応答と高効率な学習を実現

FLUX 3とFLUX-mimicの概要

  • FLUX 3 は画像・ビデオ・音声を統合的に生成・理解するマルチモーダル基盤モデル
  • FLUX 1, 2は画像生成に特化、FLUX 3は音声・映像を同時に扱う拡張
  • mimic robotics はロボット学習・実装に強み、BFLは基盤モデル開発に特化
  • 両者の協業によりFLUX-mimicを開発、Audiの工場で検証・展開
  • FLUX-mimicは次世代のビデオアクションモデルとして汎用的な操作を実現

モデルの特長と学習戦略

  • 動画生成 は学習コストの95%以上を占め、現実世界の物理法則理解が必須
  • 動画の正確な生成には「接触」「運動」「重さ」「因果関係」などの習得が不可欠
  • 音声やアクションは低次元表現であり、動画理解後は容易に学習可能
  • アクション予測も既存の世界モデルの延長線上で実現
  • 単一バックボーン で画像・動画・音声・アクションを統合的に処理

アクション予測の追加とパフォーマンス

  • アクション予測追加時、一時的に動画生成品質が10%低下
  • 3,500ステップで元の品質を回復し、アクション予測も同時に習得
  • 既存能力を損なうことなく新しいモダリティを統合
  • 物理AI としてマルチモーダル基盤モデルの自然な発展

FLUX-mimicの構造とデコーディング

  • FLUX 3の中間特徴量を活用し、軽量なアクションデコーダを組み合わせ
  • 世界モデルの「生成品質」と「表現品質」が成功の鍵
  • Self-Flow 手法で生成と表現の両立を実現
  • 自己教師あり学習でロボット制御タスクの成功率向上

スケーリングと産業応用

  • FLUX 3は数千万時間の一般動画、数十万時間の人・ロボット操作動画で大規模学習
  • mimicはFLUX-mimicを工場現場(部品キッティング、ECU挿入、組み立て、柔軟物操作等)に導入
  • アクションデコーダは従来のVision-Language-Actionモデルを大幅に上回る性能
  • Self-Flow とスケーリングにより少ないデータで高い学習効率

タスク適応と自己回復能力

  • 世界モデルが物理法則を内部表現として保持
  • 新タスクへの適応は「既知の知識を応用」するだけで済む
  • デモデータが少なくても高い成功率、失敗時も自己修正可能
  • ロボットが自律的に失敗から回復し、タスクを完遂

実運用での高速応答

  • FLUX-mimicのバックボーンは80ms以下で世界表現を生成
  • mimic独自の最適化で全体のリアクションタイムは101ms
  • 少ないパラメータで高性能を維持し、実運用に適応
  • センサー・モデル・アクチュエータ間の遅延も最小化

工場現場での価値

  • Audiなど高度自動化工場の現場で従来自動化が困難だった領域に適用
  • 柔軟物や複雑な組み立てなど、従来ロボットが扱えなかったタスクを実現
  • FLUX-mimicによる「現実世界で使える物理AI」の実証

Hackerたちの意見

ヨーロッパのスタートアップ同士のパートナーシップを見るのはいいね。

FluxってMetaに買収されたんじゃなかったっけ?

すごく興味深いね。要するに、よく訓練されたマルチモーダルな動画生成モデルには、内部に世界表現モデルが組み込まれてるってことだ。彼らはこの世界モデルをロボットに展開する作業をしていて、どうやらうまくいってるみたい。確かに新しいアイデアではないけど、質の高い動画モデルは材料や光、世界についての理解を持ってる(少なくともオッカムの剃刀的な理解の範囲でね)。ただ、動画ラボがロボットラボに変わったって話はまだ聞いたことがないから、これが初めてかもしれないし、振り返ってみれば明らかになる新しいビジネスパスかもね:動画モデルを訓練して、動画生成を売って、スケールアップして、そのスケールを使ってロボットのことを訓練する:利益。彼らの手の動きがすごく興味深いよね。手袋の中に隠れてるものがたくさんあるみたいだし、XiamiのRobotics-1基盤モデルは、結構標準的なグリッパーでユーザーが訓練してる動画を最近公開したみたい。グリッパータイプの手袋をつけてそのモデルを訓練するための動画デモもあるくらいだよ。BFLモデルはそれが全く必要ないみたい。ハードウェアの難しさを考えると、彼らがこれをどうするのか楽しみだね。

この戦術は普通じゃない?Nvidiaは動画生成モデルを使ってロボットを訓練するデモをしてるし、Waymoもそれをずっとやってるよ。

3分30秒くらいの動画で、ロボットアームが窓のトリムを再取り付けするのに3回も挑戦してたのはちょっと不安だったな。こんなの見たことないよ。これって新しい技術なの?それとも俺が完全に情報に疎いだけ?

うん、あれは印象的だったね。

確かに、情報に疎いね。Googleは1年以上前に、張力のかかったタイミングベルトを置き換えるVLAベースのボットを作ったんだよ。すごいことだよね。

すごい仕事だね。u.i. Zuglóロボット、いつ出るの?

ここでの表現、ちょっと気になるんだけど、> ただし、表現学習のためのより専門的なアプローチと比べると、彼らはあまり分離された表現を生成しないため、世界理解を必要とするタスクに対する有用性に上限がある。実際の世界で人々に「より絡み合った」概念の説明をしようとする際に、LLMだけがあまり分離されていない表現を使うことになる。

悪いニュースだけど、人間はいつもくだらないことを書くよね。むしろ、LLMは人間よりも awkwardな表現をする可能性が低いと思うよ。なぜなら、そういう表現は訓練データにはあまり含まれていないから。

今はLLMに影響された文章の兆候を引っ張り出してるだけだね。そろそろ、非難するのはやめて、すべての文章が少なくともLLMの助けを借りてると考えて、質だけで判断する時期かも。

これが未来だね。でも、今でもある。もしソフトウェア開発やエンジニアリングの世界にいる人がいたら、これを伝えてあげて。

Hacker Newsで議論の続きを見る