概要
- Xiaomi-Robotics-1 は大規模なエンボディメントフリー事前学習と実ロボットデータによる後学習を組み合わせたロボット基盤モデル
- 事前学習には 10万時間超のUMIデータ を使用し、幅広い環境とタスクをカバー
- データ量とモデルサイズの増加により、 性能が一貫して向上 するスケーリング挙動を確認
- 少量の実ロボットデータで新規タスクに高効率で適応可能、シミュレーションベンチマークでも 最先端の成績 を達成
- ロボット分野における データボトルネック解消の実践的アプローチ を提示
Xiaomi-Robotics-1の概要と背景
- 言語・画像分野のFoundation Model はスケーリング則に従い進化
- ロボティクス分野では 大規模・高品質データの不足 がモデルスケーリングの壁
- Xiaomi-Robotics-1 はエンボディメントフリーなUMI事前学習と、実ロボットデータによる後学習の2段階構成
- 事前学習で 多様な環境・タスク を網羅した広範な行動表現を獲得
- 後学習で 実ロボット適用性と自然言語指示理解 能力を強化
データセット構築とアノテーション手法
- 事前学習用データは 10万時間超・1700超のシナリオ をカバー
- 家庭・商業施設・工場・屋外など多様な環境
- 自動ラベリングパイプライン を開発
- 長尺動画を固定長クリップに分割し、VLMで状態遷移を言語記述
- 後学習用データは 社内実ロボットデータ・オープンソース・高品質UMI を活用
- 7200時間超の家庭内実ロボットデータ(例:ソファ整理・靴箱整頓・台所片付けなど)
- UMIデータは 手動で時間区切り・指示プロンプト を付与
学習手法とスケーリング挙動
- LLMと同様の2段階学習パラダイム
- 事前学習:UMIデータで 行動生成の汎用表現 を獲得
- 後学習: 実ロボット適用性・指示追従性 のアラインメント
- 事前学習は 幅広さ重視、自動アノテーションで大量データを効率的に活用
- データ・モデルサイズ増加でバリデーションエラーが着実に減少
- 後学習で 実ロボットの身体性・自然言語指示 との整合性を強化
- スケーリング則が後学習後も維持 され、データ・モデル拡大で成功率が向上
実ロボットおよびシミュレーションでの応用
- 後学習済みモデルは 多様な実ロボットタスクに即時適用可能
- 新タスクへの効率的適応:数時間のデモで高成功率
- 例:Phone Packing, Printer Refilling, Laundry Loading, Box Packing
- 平均10時間未満で75%、40時間未満で85%の成功率
- π0.5ベースラインの約2倍の効率
- 新タスクへの効率的適応:数時間のデモで高成功率
- 4つの主流シミュレーションベンチマーク で最先端成績
- RoboCasa, RoboCasa3, VLABench, RoboDojoで全て2位以下を大幅に上回る
- 汎化能力とスケーリング効果の実証
結論と今後の展望
- Xiaomi-Robotics-1 はロボット基盤モデルのスケーリングに実践的道筋を提示
- 大規模UMI事前学習で データボトルネックを打破
- 実ロボット・指示アラインメントで 物理ロボットへの能力転写 を実現
- 事前学習でのスケーリング則が後学習・実ロボット応用でも一貫して効果を発揮
- 少量データで新タスクに高効率適応 し、シミュレーションでも最先端成績
- 今後もさらなるスケーリング・新規応用が期待される
参考文献
- Guo, Jun et al., "Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories", arXiv preprint arXiv:2607.15330, 2026