世界を動かす技術を、日本語で。

アトラス:空間知能のための世界モデル

2026年9月2日原文(worldlabs.ai)

概要

  • World Labs が開発した次世代ワールドモデル Atlas の特徴と技術的詳細の解説
  • Atlasは テキスト・画像・動画・3D を統合的に扱う マルチモーダル生成AI
  • 世界生成・再構築・シミュレーションなど多様なタスク対応
  • 精密なカメラ制御空間的文脈管理 による高精度な出力
  • ロボティクス・VFX・デザイン 分野への応用可能性

Atlas:次世代ワールドモデルの概要

  • Atlas は、 World Labs が開発した 汎用ワールドモデル
  • テキスト・画像・動画・3Dデータを ネイティブに統合処理 する マルチモーダル拡散トランスフォーマー 構造
  • 入力データを 空間的文脈(spatial context) として統合し、そこから一貫性のある3D出力や新たな視点を生成
  • スケーラビリティ に優れ、学習計算量の増加に伴い性能が向上
  • 想像世界の生成や現実世界の高精度シミュレーション、ロボットの行動計画支援など幅広い用途

主な機能・応用例

  • カメラ制御生成

    • 1枚または複数の画像から、任意のカメラ位置・角度で新しい画像や動画を生成
    • 最大1分・1440pの高解像度動画生成に対応
    • 入力画像の内容・幾何を正確に反映しつつ、見えない部分も自然に補完
  • 空間再構築

    • 少数の画像から 現実空間の3D再構築 が可能
    • 入力画像が増えるほど再現性が向上し、最先端の3D再構築専用モデルを上回る精度
    • 1枚の地上写真から空撮視点を生成、複数画像で全体構造を忠実に再現
  • 多様なカメラパス生成

    • 同じ入力画像セットから異なるカメラ軌道で複数の映像を生成
    • カメラパスの変更に応じて、シーンの強調点や雰囲気を自在に変化
  • 明示的3D出力

    • 2D画像や動画だけでなく、 3D点群や3D Gaussian splats として出力可能
    • 1枚の画像から新たな視点と幾何情報を同時生成し、3D再構築へ変換
    • Roboticsやゲーム、VFX、設計ワークフローに活用
  • 空間・時間シミュレーション

    • 入力動画から空間構造と時間変化を学習し、ビデオのリフレーミングやリアルからシミュレーションへの変換を実現
    • 少数カメラ映像から「バレットタイム」風のマルチビュー動画を生成
    • ロボットの視点でRGB・深度データを生成し、ナビゲーションや操作シミュレーションに活用
  • 画像生成

    • 複雑なテキストプロンプトや画像プロンプトから多様なビジュアルスタイルの画像・360°パノラマを生成
    • 画像内テキストのレンダリングにも対応

技術的詳細

  • アーキテクチャ

    • Atlasは マルチモーダル・オートレグレッシブ拡散トランスフォーマー
    • テキスト・画像・カメラポーズ・3D深度マップなど多様なデータを統一的に扱う
    • 各入力を3D空間上に配置し、空間的文脈を形成
    • その文脈に基づき、次に生成すべき要素を逐次的に出力
    • LLMや従来のビデオモデルとは異なる新規設計で、空間制御を中核に据える
  • スケーラビリティ

    • モデルサイズや学習計算量を拡大することで性能が持続的に向上
    • 今後のさらなるスケールアップにも対応
  • 統合性

    • 2Dフレームと3Dデータを同時に扱い、 Marble などWorld Labs製品群との連携を想定

今後の展開と可能性

  • Atlas は今後、 Marble をはじめとするWorld Labsの各種プロダクトの基盤技術として活用予定
  • VFX、ロボティクス、空間デザイン、ゲーム開発 など、多様な産業分野への応用が期待される
  • 少数の実画像から高精度な3D再構築や多様なシミュレーションが可能となり、 創造性と現実性の両立 を実現

Hackerたちの意見

これまでのところ、スパースな画像から3D空間を再構築するためのモデルとしては、これが一番良さそうだね。スマホで撮った十数枚の画像から、家全体をかなり忠実に再現できるみたい。動画の動きに合わせて機能しているのを見せているけど、カメラが動いている間は時間が常に止まっているように見えるし、時間を進める前に必ず基準となるカメラビューに戻ってる。もしかして、時間的な一貫性があまり良くないのかな?これだけ空間を理解しているのに、ちょっと驚きだよ。物理や時間のモデル化が、この種のモデルの次のステップなんだろうね。

凍った時間に加えて、アトラスはある程度のシーンの動きにも対応できるよ。例えば、カメラ制御生成セクションのキャンディー・ニューヨークシティでは車が動いているし、1分の動画の最後の方では波の微妙な動きも見られる。でも、これは確かに今後改善していく予定の一つだね。

ワールドモデルって具体的に何を指すの?最近、最先端の何かを説明するためにいろんな場面で使われすぎて、意味が分からなくなっちゃった。

それは人によっていろいろ意味があるよ。基本的には、3D世界を理解していて、テキストや画像の入力から新しい視点を生成できるものがワールドモデルだね。ロボティクスで使われるのをよく見かけるよ。現在のビューを入力して、やりたいアクションを説明すると、アームの動きを計画してくれるんだ。(ソフトボディの操作には本当に役立つ。)他にも意味はあるけど、要はワールドモデルはテキストではなく3Dで推論できるってことだね。

それは、理解している世界の内部表現を構築して(物理を扱ったり、予測したり、修正したりできる)、それをレンダリングすることを意味するよ。

空間的推論がLLMには欠けているAIモデルにとって、これは多義的な用語だね。私が聞いた中でのベストな定義は、周囲の内部マップを構築して、次に何が起こるかを予測し、その予測に基づいて意思決定を行うAIシステムだよ。いろんなアプローチが試されているね。 - ワールドラボ(この投稿にリンクされている)は、ニューラル3D表現の研究(NeRFや3Dガウススプラッティング)を進めている。 - ヤン・ルカンはJEPAアーキテクチャに賭けていることで有名だね(詳しくはWelch Labsの素晴らしい動画をチェックしてみて)。 - グーグルは生成的な動画に賭けている。 - カール・フリストンは「アクティブインターフェレンス」を追求していて、これは異なる報酬関数を持つ伝統的な強化学習技術だよ。

これはオーバーロードされた用語で、いろんな人がいろんな意味で使ってるよね。World Labsでは、世界モデルを3つの主要なカテゴリに分けて考えてるんだ。- レンダラーは、リアルな世界か生成された世界のピクセルやビューを出力する - シミュレーターは、世界がアクションにどう反応するかを予測する - プランナーは、世界に変化をもたらすためにエージェントが取るべきアクションを予測する この分類で言うと、アトラスはレンダラーとシミュレーターの間に位置してる。高品質な一貫した3D世界のビューを予測する(レンダラー)けど、シミュレーションを助けるために明示的な3Dも予測できる。アトラスは今のところロボットを直接動かすアクションを予測しないから、ネイティブなプランナーではないけど、そのシミュレーション能力は別のモデルをプランナーに育てるのに役立つかも。出典: https://www.worldlabs.ai/blog/taxonomy-of-world-models

ロボティクスにおいて、再構築は仕事の半分に過ぎない。シミュレーションされたロボットが空間を移動する際、アトラスはそのセンサーが観測するRGBと深度データも生成する。世界とロボットの視点は同じモデルから来ているんだ。ロボティクスのデータフライホイールの課題を加速させるのに非常に重要かもしれないね。

ワールドラボの共同創設者なんだけど、アトラスについての質問には喜んで答えるよ!

空間コンテキスト機能、めっちゃクールだね!制限とかあるのかな?全ての写真にジオタグや回転タグを付けて、それを一つの大きな空間コンテキストにまとめて、アトラスを通して世界の3Dモデルを作るには何が必要なんだろう?

アクセスをください! :) 私たちは博物館や旅行者のために超役立つことをやってるから、これが大きな解放になるんだ!それに、Dr.Liの大ファンでもあるよ!

GoogleのGenie 3や他の似たようなモデルと比べてどうなの?一見すると、視覚的にはかなり印象的に見えるけど。

Hacker Newsで議論の続きを見る