世界を動かす技術を、日本語で。

ロボットアームにおけるGPT-6 Astra

概要

  • GPT-6 Astraは「ブロックをボウルに入れる」タスクで圧倒的な成功率とコスト効率を示す
  • 「パズルピース挿入」タスクでは全モデルが同様に苦戦し、成功率は低水準
  • Astraは推論速度・コスト両面でFableシリーズより優位性を持つ
  • 評価は人間オペレーターによるステージ到達度で判定
  • 比較にはリグや試行タイミングなど若干の制約あり

GPT-6 AstraとFableシリーズのロボット制御性能比較(2026年9月)

  • 評価対象モデル :GPT-6 Astra、Claude Fable 5、Claude Fable 5.1
  • 制御対象 :YAMアーム(6自由度、パラレルグリッパー装備)
  • 観測情報 :3台のカメラ+プロプリオセプション
  • 実験タスク
    • 赤いブロックをテーブルから拾い、ボウルに入れるタスク
    • 青い丸型パズルピースを中央ノブで持ち、対応する溝に挿入するタスク

ブロックをボウルに入れるタスク

  • Astraの成功率 :95%(19/20回)
  • Fable 5.1の成功率 :40%(8/20回)
  • Fable 5の成功率 :5%(1/20回)
  • Astraの平均所要時間 :2.5分/回
  • Fable 5.1の平均所要時間 :6.8分/回
  • Astraの推定コスト :$0.94/回
  • Fable 5.1の推定コスト :$2.12/回
  • Astraの特徴 :2.4倍高い成功率、2.3倍安価な実行コスト

パズルピース挿入タスク

  • Astraの成功率 :10%(2/20回)
  • Fable 5.1の成功率 :10%(2/20回)
  • Astraの平均所要時間 :3.4分/回
  • Fable 5.1の平均所要時間 :5.9分/回
  • Astraの推定コスト :$1.36/回
  • Fable 5.1の推定コスト :$2.18/回
  • 全モデル共通の課題 :最終挿入ステップで停止し成功率が伸び悩む

評価方法とスコアリング

  • 人間判定によるステージ評価
    • 0:アプローチなし
    • 1:対象物への接触
    • 2:持ち上げ成功
    • 3:目的位置に配置
    • 4:最終位置への正確な設置
  • 各試行は最高到達ステージでスコア化
  • 合計120試行のデータに基づく集計

技術仕様・実験条件

  • 制御方式 :絶対座標指定(x, y, z, ヨー、ピッチ、ロール、グリッパー)
  • ポリシー :Inspect Robotsエージェントポリシー(中程度推論、20回LLMコール上限、25%速度制限、安全ガードレール有効)
  • トライアル数 :各モデル・各タスクごとに20回
  • コスト算定 :リスト価格(入力$10/100万トークン、出力$50/100万トークン)

制約・注意点

  • Astraの試行はFableの2日後に実施
  • パズルタスクは同一リグ、ボウルタスクは異なるリグで比較
  • 評価者はモデルを知った状態での判定(無意識バイアスの可能性)
  • Astraのコストは自動キャッシュ分を割引せず算出(実際より高めの見積もり)
  • 全モデル中程度推論設定で統一
  • 物体のリセットは手作業で実施

まとめ

  • GPT-6 Astraは物体把持・移動タスクでFableシリーズを大きく上回る性能
  • パズルタスクでは全モデルが課題を残すため、今後の改善余地
  • コスト・速度・成功率でAstraの優位性が明確
  • 人手による評価やリグ環境の違いなど、完全な条件一致ではない点に留意が必要

Hackerたちの意見

彼らが言ってる制限は、あんまり影響ないと思うけど、言及してくれたのは優しいよね(それに、偏りのない研究だし)。彼らに拍手!

中程度の努力で運営されてたって聞いて、なんか嬉しいな。

LLMは面白い技術だよね。一方で、彼らの進化は確かにすごいんだけど、興味のない分野でのブレークスルーがないのはちょっと残念。数学やプログラミングが好きなんだけど、LLMはそれに関しては結構優秀。でも、洗濯物を畳むのも上手くなってくれないかな?ロボティクスの研究がこの「つまらない」ブレークスルーを解決してくれることを期待してるけど、いつになるのかな。

もうすぐだよ。サンデーロボティクスは、99%の精度で服を畳む3時間の配信をしてたよ。自分で見てみて。最近の2ヶ月で、すごい動画を出してる「手」系の会社がたくさんあるし。あとは、フィギュアのパッケージ操作のマルチデイライブストリームもすごかった。物理的なLLMは確実に来てるよ。十分なトレーニングデータがあれば、LLMはどんな分野でも一貫したデータを出力できるってわかってるから、時間の問題だね。

ボトルネックは知能じゃないんだよね。君が望むことをするロボットは作れる。アマゾンのロボット倉庫ツアーに行ってみて。今の技術では壊れやすくて出荷できないんだ。数週間ごとに100kgのロボットをメンテナンスのために持ち込むのは厳しいよね。自動車の初期の数十年もこんな感じだった。車を近所のディーラーに持って行けるようになったら、状況は一変した。ロボットの物流を想像するのは楽しいけど、材料科学と工学はもう少し進歩しないとね。

もしデータ生成にお金をたくさん使わない限り、洗濯物をたたむための機械的なステップが一般的なトレーニングセットにあまり多くないとは思えない。誰かが、経済的に実現可能な安いハードウェアシステムを見つけて、それをトレーニングしなきゃならない。人々がロボットにお金を払うタスクとしては、これってあまり優先順位が高くない気がする。

現代のAIを使ったロボティクスについてコメントしている人たちより、洗濯物をたたむのにかける時間がかなり少ないことに気づいたよ。これは文字通りの意味じゃないよね?例えば、床やカウンタートップをきれいに保つ方が、私にとってはずっと時間がかかる気がする。

問題は、ビットを大規模に操作するのが原子を操作するよりも桁違いに得意だってことだ。次の10年で家庭用の高度なロボットが普及するとは思ってないよ。でも、そう言えばLLMが来るとは思ってなかったしね。

服を畳むのはいいから、ロボットに私の専属シェフになってほしいな。私がキッチンで作れる料理をロボットが作るには、いろんなタスクや能力が必要で、まだまだ解決には時間がかかりそうだよね。

未来は近づいてるよ。3〜4世代(毎年1つ?)でこれが展開されるだろうね。主に量子コンピュータが材料やバッテリーを改善して、ヒューマノイドが標準化されてモジュール化されて簡単に交換できるようになる(IBM PCみたいに)。ほとんどの部品は簡単に射出成形された先進プラスチックで、中国のどこかで大量生産されて、摩耗を自己検出してその部分を自動で交換する。他には光コンピュータ(100倍低消費電力×100倍速度=ローカル推論)。問題は、これが現実になるのはいつで、誰が一番得をするのか、誰が優位性を持つのかってことだね。

既存のモデルは知能に対する brute-force アプローチだからだよ。十分なデータと計算があれば、確率的なオウムはかなり印象的になる。でもロボティクスでは、オウム返しできる既製のデータセットはないんだ。例えば、服を畳む方法みたいなデータセットは人間が作らなきゃいけない。まるで人間がLLMにコードの書き方を教えるためにクイックソートのアルゴリズムを書かなきゃいけないみたいだね。

最も利益を上げている企業が依存している、高度なスキルと高価な労働を自動化することに経済的価値があるから、最も多くの投資と努力を引き寄せるんだ。仕事を失ったら、嫌な雑用をするための時間がたっぷりできるよ。冗談はさておき、プログラミングや数学は整然とした環境だからね。すでにデジタルで検証可能だし、GPUクラスターで処理するのに最適なんだ。現実の世界はそれに比べて大きくて遅くて複雑だよ。

Hacker Newsで議論の続きを見る