世界を動かす技術を、日本語で。

シャオミロボティクス1

概要

  • Xiaomi-Robotics-1 は大規模なエンボディメントフリー事前学習と実ロボットデータによる後学習を組み合わせたロボット基盤モデル
  • 事前学習には 10万時間超のUMIデータ を使用し、幅広い環境とタスクをカバー
  • データ量とモデルサイズの増加により、 性能が一貫して向上 するスケーリング挙動を確認
  • 少量の実ロボットデータで新規タスクに高効率で適応可能、シミュレーションベンチマークでも 最先端の成績 を達成
  • ロボット分野における データボトルネック解消の実践的アプローチ を提示

Xiaomi-Robotics-1の概要と背景

  • 言語・画像分野のFoundation Model はスケーリング則に従い進化
  • ロボティクス分野では 大規模・高品質データの不足 がモデルスケーリングの壁
  • Xiaomi-Robotics-1 はエンボディメントフリーなUMI事前学習と、実ロボットデータによる後学習の2段階構成
  • 事前学習で 多様な環境・タスク を網羅した広範な行動表現を獲得
  • 後学習で 実ロボット適用性と自然言語指示理解 能力を強化

データセット構築とアノテーション手法

  • 事前学習用データは 10万時間超・1700超のシナリオ をカバー
    • 家庭・商業施設・工場・屋外など多様な環境
  • 自動ラベリングパイプライン を開発
    • 長尺動画を固定長クリップに分割し、VLMで状態遷移を言語記述
  • 後学習用データは 社内実ロボットデータ・オープンソース・高品質UMI を活用
    • 7200時間超の家庭内実ロボットデータ(例:ソファ整理・靴箱整頓・台所片付けなど)
    • UMIデータは 手動で時間区切り・指示プロンプト を付与

学習手法とスケーリング挙動

  • LLMと同様の2段階学習パラダイム
    • 事前学習:UMIデータで 行動生成の汎用表現 を獲得
    • 後学習: 実ロボット適用性・指示追従性 のアラインメント
  • 事前学習は 幅広さ重視、自動アノテーションで大量データを効率的に活用
  • データ・モデルサイズ増加でバリデーションエラーが着実に減少
  • 後学習で 実ロボットの身体性・自然言語指示 との整合性を強化
  • スケーリング則が後学習後も維持 され、データ・モデル拡大で成功率が向上

実ロボットおよびシミュレーションでの応用

  • 後学習済みモデルは 多様な実ロボットタスクに即時適用可能
    • 新タスクへの効率的適応:数時間のデモで高成功率
      • 例:Phone Packing, Printer Refilling, Laundry Loading, Box Packing
      • 平均10時間未満で75%、40時間未満で85%の成功率
      • π0.5ベースラインの約2倍の効率
  • 4つの主流シミュレーションベンチマーク で最先端成績
    • RoboCasa, RoboCasa3, VLABench, RoboDojoで全て2位以下を大幅に上回る
    • 汎化能力とスケーリング効果の実証

結論と今後の展望

  • Xiaomi-Robotics-1 はロボット基盤モデルのスケーリングに実践的道筋を提示
  • 大規模UMI事前学習で データボトルネックを打破
  • 実ロボット・指示アラインメントで 物理ロボットへの能力転写 を実現
  • 事前学習でのスケーリング則が後学習・実ロボット応用でも一貫して効果を発揮
  • 少量データで新タスクに高効率適応 し、シミュレーションでも最先端成績
  • 今後もさらなるスケーリング・新規応用が期待される

参考文献

  • Guo, Jun et al., "Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories", arXiv preprint arXiv:2607.15330, 2026

Hackerたちの意見

二本腕のロボットを見てると、もしかしたら別の能力を持った第三の手、例えば触手みたいなグリップがあったら、いろんな作業が楽になるんじゃないかって思うんだ。手が増えると問題も増えるって分かってるけど、それでも物を持ったり回したりする方法が増えるのは大きな助けになるよね。

車の作業をしたことがある人なら、余分な手があれば絶対助かるって分かるよね。

まさにその通りだけど、それを訓練するには誰かが手動で操作しているデータがたくさん必要だよね。たった二本の手でも、人間がやってる映像がたくさんあれば十分だと思う。将来的にはロボットが自己改善できるようになるか、誰かがこれを最適化する方法を考え出すかもしれないね。

そうそう、シーツを折るには4本の手が必要だよね。しかも各ペアの間に大きな距離があるし。

サイエンスフィクション小説「神の目の中の小さな粒」には、3本の手を持つエイリアンが登場するんだ。一つは「つかむ手」でお腹から出ていて、あとの2本は細かい作業用の器用な手。これで英語の表現が乱用されることになったんだ。「一方では…もう一方では…つかむ手では…」ってね。

これって特定のハードウェアプラットフォームが必要なのかな?それとも、例えば安いミニロボットに一つのカメラ(深度がなくても大丈夫なやつ)とトラック付きのキャタピラ、アームを使っても動かせるのかな?

トレーニングはハードウェアに特化してるんじゃないかな。

ページに「エンボディメントフリー (UMI)」って書いてあるときは、標準化されたグリッパーとカメラの配置を使ってるってことだね。[1] それで、グリッパーが取り付けられているロボットアームの種類には依存しないようにしてるんだ。[1] https://umi-gripper.github.io/

「スロップフォールド」って言葉を作ったよ。ロボットが服を畳んでくれるけど、ちょっとシワシワでダラっとしてる。でも、ちゃんと畳んでアイロンかけた服よりも楽だから、まあいいかって受け入れちゃう感じ。

スロップフォールドは、流行る前からやってたよ。

それが技術の物語じゃない?コーヒーマシンが初めて登場したときは、バリスタの方が絶対に良い選択肢だった。でも、進化を経て、今では多くの場合、マシンの方がバリスタよりもいい仕事をしてるよね。

あなたの育ちってどれくらい恵まれてたの?

Hacker Newsで議論の続きを見る