世界を動かす技術を、日本語で。

フラックス 3

2026年7月24日原文(bfl.ai)

概要

  • FLUX 3 は画像・動画・音声を統合的に学習する 新しいマルチモーダル基盤モデル
  • テキスト、画像、動画、音声を 組み合わせて生成・理解 可能
  • 初期評価 で他の先進モデルより高い評価を獲得
  • 画像・動画生成、アクション予測など 多様な機能 を段階的に提供予定
  • 物理AIやコンテンツ制作など 幅広い応用分野 を想定

FLUX 3とは何か

  • FLUX 3 は画像、動画、音声を 統合的に学習 するマルチモーダル基盤モデル
  • Self-Flow アプローチに基づき、効率的なマルチモーダル生成と理解を実現
  • 画像・動画・音声を 同時に学習 し、それぞれの特徴を相互に補完
  • 一つのモダリティだけでなく、 複数モダリティの同時学習 で現実世界の本質的な表現を獲得
  • 物体の構造、動き、音の因果関係など、 現実世界の理解 を目指す

モデルの主な特徴

  • テキスト・画像・動画・音声 の生成・編集に対応
  • テキストから動画や画像、画像から動画、動画から動画など 多様な生成パターン をサポート
    • テキストtoビデオ、画像toビデオ、動画to動画、動画+音声の連続生成など
  • 20秒までの動画生成、ネイティブな音声合成、複数言語対応
  • スタイルの多様性 (カメラ映像からアニメーション、シネマティックまで幅広く対応)
  • 一貫性のあるキャラクター表現 や、物理イベントと音の関連付けに強み
  • タイポグラフィ生成 やアニメーションデザインも得意

性能評価と他モデルとの比較

  • 初期評価で Grok Imagine Video(69%)、Kling v3 Pro(60%)、Happy Horse v1(59%)、Runway Gen-4.5(77%)、Luma Ray 3.2(93%) など他の先進モデルより高い支持率
  • 人の表情表現、物理イベントと音の関連付け、多言語対応 で特に高評価
  • 生成結果は初期段階ながら、 今後さらなる改善 を予定

画像生成・編集機能

  • 多様なスタイルやアスペクト比、解像度 で画像を生成・編集可能
  • 複雑なプロンプトや多言語テキスト生成の対応力が 従来モデルより大幅向上
  • 画像生成機能も 早期アクセス段階 で順次公開予定

アクション予測とロボティクス応用

  • アクション予測機能 をFLUX 3本体に統合
  • mimic robotics との連携で、ロボットの巧緻動作や生産現場での実用化を目指す
  • FLUX-mimic として、動的環境でのアクション予測モデルを開発

今後の展開と提供計画

  • 動画・音声生成/編集APIアクション予測API画像生成APIマルチモーダル基盤モデルのオープンウェイト提供 を順次開始
    • FLUX 3 Video、FLUX-mimic & FLUX 3 Action、FLUX 3 Image、FLUX 3 Devとして展開
  • 早期アクセス を通じてフィードバック収集と安全性検証を実施
  • 技術的詳細も 今後公開予定

今後のビジョンと募集

  • インタラクティブな画像・動画編集、シミュレーション、物理AI など多様な応用を想定
  • 知覚・行動・言語予測の統合モデル の開発を目指す
  • ドイツ・米国で採用活動中、開発や実証実験への参加を呼びかけ

FLUX 3 は、現実世界の多様な情報を統合的に学習・活用することで、次世代の知覚・生成AIの基盤となることを目指しています。

Hackerたちの意見

  • 人の例がほとんどゼロだった。 - 「ワールドモデル」って言葉の使い方が軽すぎる。 - 20秒の動画を主張してるけど、ジャンプカットしか見せてない。もうすぐ公開!

/r/stablediffusionにはたくさんの動画例があるよ。

うん、すごく変なローンチだった。動画はどこ?って感じだったよ。

軽薄な「ワールドモデル」という用語の使い方 モデルベースの強化学習でかつて使われていた「ワールドモデル」という用語が、今では線形回帰のような馬鹿げたものを指すことができるらしい。まあ、強化学習の人たちはその用語を行動科学者から借りたんだろうね。これを受け入れるのが一番いいかも :/ 「オブジェクト指向」も哲学者や視覚芸術家によって誤用されたことがあったし。

オープンウェイト版がSOTAになることを期待してる。 > 今後数週間から数ヶ月の間に、以下の機能を提供する予定です。 > コンテンツ制作(動画、音声、画像)とアクション予測のためのマルチモーダルバックボーンへのオープンウェイトアクセス。(「FLUX 3 Dev」) > 基本的なアプローチについての技術的な詳細も公開する予定です。

オープンウェイトの約束はいい感じだけど、1) 以前のリリースでそういう期待が何も実現しなかったってコメントを見たことがある(どの約束がされたのかは分からないけど);2) バックボーンがDevとしてリリースされたら、何が欠けるの? 投稿からはよく分からないな。

ここでのコメントがすごくネガティブで冷淡なのが信じられない。私はこのモデルがかなりすごい能力を持ってると思ってるのに。でも、ネガティブな人たちが最初にここにクソコメントを残すって聞いたことあるから、どうなるか見てみよう。

HNの感情分析を時系列で見てみると面白いかも。主観的には最近HNにはネガティブな雰囲気が漂ってる気がするけど、間違ってたらいいな。

広告主はこういう反応が大好きだよね。ここにはただ「すごい!」って言ってるだけで、実際には見せてくれない。

スタートレックのホロデッキに比べたら、これには全然ワクワクしない。

社会としての行動の結果を気にする人がいるからかもしれないね。好奇心を満たすだけじゃなくて。ちなみに、好奇心自体には何の問題もないと思うけど、技術分野でのようにそれを孤立させるのは危険で無責任な態度だと思う。

現行の「スマート」LLMを使ってコーディングや自動化ツールの構築をしてる人間なんだけど、オープンソースのいろんなものを組み合わせて新しいプロジェクトを作る地味な作業もやってるんだ。これには結構楽観的だよ。特に、いいハーネスのセットアップがあって、モデルが論理の行き止まりに入ったり、ちょっとおかしなものを作ったりした時に気づけるだけの知識があるときはね。でも、同時にSNSはひどいAIのゴミ画像や動画であふれてるのも見える。完全に人工的な画像や動画生成器の実用的な社会への利益には、あまり楽観的になれないな。これらが何百万もの人の手に渡ると、社会にとって有害な使い方をされることが多い気がする。

Hacker Newsで議論の続きを見る