概要
- World Labs が開発した次世代ワールドモデル Atlas の特徴と技術的詳細の解説
- Atlasは テキスト・画像・動画・3D を統合的に扱う マルチモーダル生成AI
- 世界生成・再構築・シミュレーションなど多様なタスク対応
- 精密なカメラ制御 や 空間的文脈管理 による高精度な出力
- ロボティクス・VFX・デザイン 分野への応用可能性
Atlas:次世代ワールドモデルの概要
- Atlas は、 World Labs が開発した 汎用ワールドモデル
- テキスト・画像・動画・3Dデータを ネイティブに統合処理 する マルチモーダル拡散トランスフォーマー 構造
- 入力データを 空間的文脈(spatial context) として統合し、そこから一貫性のある3D出力や新たな視点を生成
- スケーラビリティ に優れ、学習計算量の増加に伴い性能が向上
- 想像世界の生成や現実世界の高精度シミュレーション、ロボットの行動計画支援など幅広い用途
主な機能・応用例
-
カメラ制御生成
- 1枚または複数の画像から、任意のカメラ位置・角度で新しい画像や動画を生成
- 最大1分・1440pの高解像度動画生成に対応
- 入力画像の内容・幾何を正確に反映しつつ、見えない部分も自然に補完
-
空間再構築
- 少数の画像から 現実空間の3D再構築 が可能
- 入力画像が増えるほど再現性が向上し、最先端の3D再構築専用モデルを上回る精度
- 1枚の地上写真から空撮視点を生成、複数画像で全体構造を忠実に再現
-
多様なカメラパス生成
- 同じ入力画像セットから異なるカメラ軌道で複数の映像を生成
- カメラパスの変更に応じて、シーンの強調点や雰囲気を自在に変化
-
明示的3D出力
- 2D画像や動画だけでなく、 3D点群や3D Gaussian splats として出力可能
- 1枚の画像から新たな視点と幾何情報を同時生成し、3D再構築へ変換
- Roboticsやゲーム、VFX、設計ワークフローに活用
-
空間・時間シミュレーション
- 入力動画から空間構造と時間変化を学習し、ビデオのリフレーミングやリアルからシミュレーションへの変換を実現
- 少数カメラ映像から「バレットタイム」風のマルチビュー動画を生成
- ロボットの視点でRGB・深度データを生成し、ナビゲーションや操作シミュレーションに活用
-
画像生成
- 複雑なテキストプロンプトや画像プロンプトから多様なビジュアルスタイルの画像・360°パノラマを生成
- 画像内テキストのレンダリングにも対応
技術的詳細
-
アーキテクチャ
- Atlasは マルチモーダル・オートレグレッシブ拡散トランスフォーマー
- テキスト・画像・カメラポーズ・3D深度マップなど多様なデータを統一的に扱う
- 各入力を3D空間上に配置し、空間的文脈を形成
- その文脈に基づき、次に生成すべき要素を逐次的に出力
- LLMや従来のビデオモデルとは異なる新規設計で、空間制御を中核に据える
-
スケーラビリティ
- モデルサイズや学習計算量を拡大することで性能が持続的に向上
- 今後のさらなるスケールアップにも対応
-
統合性
- 2Dフレームと3Dデータを同時に扱い、 Marble などWorld Labs製品群との連携を想定
今後の展開と可能性
- Atlas は今後、 Marble をはじめとするWorld Labsの各種プロダクトの基盤技術として活用予定
- VFX、ロボティクス、空間デザイン、ゲーム開発 など、多様な産業分野への応用が期待される
- 少数の実画像から高精度な3D再構築や多様なシミュレーションが可能となり、 創造性と現実性の両立 を実現