世界を動かす技術を、日本語で。

Gemini Robotics 2がロボットに全身知能をもたらす

2026年7月31日原文(deepmind.google)

概要

  • Gemini Robotics 2 は、ロボットに全身制御・高度な器用さ・協調作業をもたらすAIモデル群
  • 複数のモデルで、ロボットが自律的に複雑なタスクを遂行・学習・適応可能
  • 安全性・責任ある開発 にも重点、ASIMOV-Agenticなど新たな安全基準を導入
  • マルチロボット協調 やオンデバイス適応など、実用性と拡張性の両立を実現
  • 人間と共に働く 汎用AIロボット への大きな前進

Gemini Robotics 2が切り開くロボティクスの未来

  • Gemini Robotics 2 は、ロボットの 全身制御・高度な器用さ・チームワーク を実現するAIインテリジェンスレイヤー
  • 従来のロボットは 単純作業や遠隔操作 が中心で、未知環境への適応やスキル転送が困難だった課題
  • Gemini Robotics 2 は、ロボットが自律的に状況を理解し、 思考・行動・対話 を統合してタスクを安全に遂行
  • Gemini Robotics シリーズの進化で、ロボットが全身を使った複雑な作業や複数ロボットによる協調作業が可能に
  • オンデバイス実行 や新しいロボットボディへの高速適応も実現

3つの主要モデルの特徴

  • Gemini Robotics 2 :最先端の ビジョン・言語・アクション(VLA)モデル、視覚・言語入力を運動制御に変換し、人型ロボットや多腕ロボットを全身制御
  • Gemini Robotics ER 2 :高度な 具現推論(ER)モデル、人間との対話・物理世界の理解・複数ステップの作業計画を担当、ロボット間の協調も実現
  • Gemini Robotics On-Device 2ローカル実行最適化VLAモデル、新しいロボットボディへの数時間での高速適応が可能

全身制御と器用さの進化

  • 人間のような全身運動 (歩行・屈伸・バランス・物体操作)をロボットで実現
  • 例:Apptronik社Apollo 2ロボットが「ジョウロを緑の箱に入れる」など、複雑な指示を全身で達成
  • 手やグリッパーの高度な器用さ も向上、22自由度の手で結び目を作る・ジップロックを閉じるなど精密作業も可能
  • 標準的な2指グリッパーでも、タイトなパッキングなど複雑作業を実現

複雑タスク・協調作業・自己修正

  • Gemini Robotics ER 2 は、高度な推論で複数ステップのタスクを管理、失敗時の自己修正や新規状況への汎化も可能
  • 数分間に及ぶ長いタスクや数百回の意思決定も安定実行
  • マルチロボット協調 も実現、異なるロボットが連携して単独では困難な作業を分担

オンデバイス高速適応と多様なロボット対応

  • Gemini Robotics On-Device 2 はネットワーク遅延なしでローカル動作、数時間・200例以下のデータで新ロボットへ適応
  • 形状・センサー・自由度が大きく異なるDexmate、SO101、Trossenなど多様なプラットフォームで実証

安全性と責任ある開発への取り組み

  • 物理的安全対策とAI安全フレームワーク を多層的に統合
  • ASIMOV-Agentic ベンチマークで、「危険なツール呼び出しの拒否」「不確実性時の人間介入要請」などエージェントの安全能力を評価
  • Gemini Robotics ER 2 は安全制約遵守・人間接近時の自動停止など、これまでで最も安全なロボティクスモデル

汎用物理AIへの道

  • Gemini Robotics 2 は、単一作業自動化を超えた 汎用インテリジェンス の実現に向けた重要な一歩
  • 人間と協働し、現実世界の複雑な課題解決を目指すAIロボットの基盤技術

参考・貢献者一覧

  • 本プロジェクトは Gemini Roboticsチーム およびGoogle・Google DeepMindの多部門の協力によって開発
  • 詳細な貢献者リストや関係チームは原文参照

Gemini Robotics 2 は、ロボットが人間社会で安全かつ柔軟に活躍するためのインテリジェンスを大幅に進化させる次世代AIモデル群です。

Hackerたちの意見

この技術に関わっている人、実際にこの技術がどこに立っているのか honestに教えてくれない?どれくらいの機器が必要なのか、インタラクションの質はどうなのか、ヒューマノイドがドアノブを回したり、転んだり、物にぶつからないようにするのにどれくらい苦労してるのか、知りたいんだよね。

個人的には、今ロボットをサービスとして売ってるスタートアップが、実際にそれを使ってリピートユーザーを得られるかが本当のテストだと思う。プロトタイプをいくつか作ったことがあるけど、進歩はあるけど、一般の顧客が日常的に役立つと感じるレベルにはまだまだ遠い。ちなみに、https://rodneybrooks.com/why-todays-humanoids-wont-learn-dex... の内容は今でも relevant だと思う。つまり、器用さはハードウェアの問題でもあって、グリッパーは手じゃないからね。「多指の器用な操作は依然として難しい」とも言ってるし、センサーがたくさん付いてる指でもないし。

まだGPT-1レベルだけど、GPT-2の瞬間が近づいてる感じがする。

この分野で働いてるけど、学士論文は人型じゃなくてVLA(ロボットアームに接続されたChatGPTみたいなもの)で書いたんだ。実用的なものにはまだまだ遠いし、建設中には正確な名前がない部分や構造もあって、それを考慮することが大事だよ。だから、ロボットが「この箱の左の部分を右の部分に置いて」って言っても、あいまいさがあるから理解できない可能性が高い。人間なら理解できるけどね。それに、ほとんどの場合、信頼できる精度テストのデータがないし(ほとんどのテストは数回のデモで行われるから、実際の動作を反映してない)、人気のベンチマークは飽和状態で、ほとんどの企業や研究者は独自のベンチマークを持ってる。企業はよく嘘をつくし、動画では危険なことをやってることもある。例えば、これらのロボットは人間の近くに立たせるべきじゃない、危険だからね。ロボットの悪用についても考慮する必要がある。悪用が戦争である必要はなく、単にトマトを切っているときに混乱させるだけでも危険だよ。ドアノブを回すのは簡単だし、失敗からの回復も進められてるけど、それに関する信頼できる統計はどこにもない。実際の作業、例えばレンガを置いたり、製造中に部品を取り付けたりする際には、すべてを正しく整列させる必要があって、これが難しいんだ。人型ロボットを家に置くのは非常に無責任だと思う(人は訓練されていないと無責任になるから)。例えば、芝刈り機は毎年約6400人を負傷させてるし、それは万能機械じゃない。人型ロボットは一般的に、関節のメンテナンスや複雑さのために魅力的じゃないけど、特に車輪付きのロボットアーム(モバイルアロハをチェックしてみて)は、ホテルでゲストが去った後の掃除や、レストランでの料理人の代わりに作業をすることができるかもしれない。

ロボット産業にはかなりのごまかしがあるよ。見かけるデモは特定のデモ用にうまく作られてることが多いし、実際に詐欺があったりすることもある。「自律型だって言ってたけど、実はデモ中は遠隔操作だった」とかね。大騒ぎされるロボット(犬型ロボットやクアドロコプターなど)は、実用性の面ではほとんど役に立たない。どんなにユースケースを作ろうとしても、実際にはほとんど失敗する。ロボティクスはニッチな産業で(コボティクスとは混同しないでね)、唯一の例外はドローン。2020年のワークショップで言ったけど、ドローンは唯一の可能性があって、耐久性の問題を解決すれば支配するだろうね。だから、すぐに武器化されたんだ。人間は悪いことに役立つものを使うから。ヒューマノイドは現実のシナリオではまだまだ役に立たないよ。面白い事実: ほとんどの(もし全ての)クアドロコプターは階段を逆に上がれない。

このロボット、動きが遅くてあんまりスムーズじゃないけど、ChatGPTみたいなLLMも最初はすごくバカに見えたよね。もし進歩がLLMみたいに早いなら、数年後には大きな応用があるかも。

家事のタスクについて、ロボット会社が自慢するのが好きだけど…正直、ロボットが人間よりも掃除に時間がかかってもあんまり関係ないよね。仕事から帰る前に終わってれば、それでいいんじゃない?

1k tok/secなら、これらのロボットは速くてすごくスムーズになると思う。

安全のためでもあると思うけど、これらのロボットは制御されていないと簡単に自分を壊しちゃうし(そして損害を引き起こす)。

ハードウェアでは、良いフィードバックループは得られないんだよね。筋肉は半億年かけて進化した素晴らしいエンジニアリングだけど、トークン生成(言葉)はせいぜい数十万程度かな。もちろん、AIがアイデアの空間をうまくナビゲートできるようになれば、合金や合成肉みたいなものを提供してくれるかもしれないけどね。

GPT-2と3の間は15ヶ月だったけど、ジェミニロボティクス1と2の間も15ヶ月だったよ:https://blog.google/products-and-platforms/products/gemini/h... GPT-2と3の違いはすごかった。2は300回同じ単語を繰り返さない限りリメリックを生成できたけど、3は実際にいくつかのことができた。比較すると、ジェミニロボティクスはほとんど変わってない。遅くて流動的でないロボティクスは、速い流動的な動きとは全く異なるレベルの難しさだって指摘しておくよ。アシモはかなりスムーズに歩けたけど、バランスを崩さないように非常に慎重な順序を使ってたから、どんな時点でも倒れずに止まれた。ボストン・ダイナミクスみたいに速く動くと、腕が振れることでバランスが変わることを考慮しなきゃいけないし、複数の質量を複雑な経路で動かすときの回転慣性も考慮する必要がある。Tシャツを90%の確率で畳むアルゴリズムは簡単だけど、99%にするか、布が静止しているのではなく実際に動いている状態で素早く畳むのは、信じられないほど複雑だよ。

進歩がLLMのように速いなら、これは新しい「x技術はあと1年で実現する」ってこと?

Hacker Newsで議論の続きを見る