概要
- GPT-6 Astraは「ブロックをボウルに入れる」タスクで圧倒的な成功率とコスト効率を示す
- 「パズルピース挿入」タスクでは全モデルが同様に苦戦し、成功率は低水準
- Astraは推論速度・コスト両面でFableシリーズより優位性を持つ
- 評価は人間オペレーターによるステージ到達度で判定
- 比較にはリグや試行タイミングなど若干の制約あり
GPT-6 AstraとFableシリーズのロボット制御性能比較(2026年9月)
- 評価対象モデル :GPT-6 Astra、Claude Fable 5、Claude Fable 5.1
- 制御対象 :YAMアーム(6自由度、パラレルグリッパー装備)
- 観測情報 :3台のカメラ+プロプリオセプション
- 実験タスク
- 赤いブロックをテーブルから拾い、ボウルに入れるタスク
- 青い丸型パズルピースを中央ノブで持ち、対応する溝に挿入するタスク
ブロックをボウルに入れるタスク
- Astraの成功率 :95%(19/20回)
- Fable 5.1の成功率 :40%(8/20回)
- Fable 5の成功率 :5%(1/20回)
- Astraの平均所要時間 :2.5分/回
- Fable 5.1の平均所要時間 :6.8分/回
- Astraの推定コスト :$0.94/回
- Fable 5.1の推定コスト :$2.12/回
- Astraの特徴 :2.4倍高い成功率、2.3倍安価な実行コスト
パズルピース挿入タスク
- Astraの成功率 :10%(2/20回)
- Fable 5.1の成功率 :10%(2/20回)
- Astraの平均所要時間 :3.4分/回
- Fable 5.1の平均所要時間 :5.9分/回
- Astraの推定コスト :$1.36/回
- Fable 5.1の推定コスト :$2.18/回
- 全モデル共通の課題 :最終挿入ステップで停止し成功率が伸び悩む
評価方法とスコアリング
- 人間判定によるステージ評価
- 0:アプローチなし
- 1:対象物への接触
- 2:持ち上げ成功
- 3:目的位置に配置
- 4:最終位置への正確な設置
- 各試行は最高到達ステージでスコア化
- 合計120試行のデータに基づく集計
技術仕様・実験条件
- 制御方式 :絶対座標指定(x, y, z, ヨー、ピッチ、ロール、グリッパー)
- ポリシー :Inspect Robotsエージェントポリシー(中程度推論、20回LLMコール上限、25%速度制限、安全ガードレール有効)
- トライアル数 :各モデル・各タスクごとに20回
- コスト算定 :リスト価格(入力$10/100万トークン、出力$50/100万トークン)
制約・注意点
- Astraの試行はFableの2日後に実施
- パズルタスクは同一リグ、ボウルタスクは異なるリグで比較
- 評価者はモデルを知った状態での判定(無意識バイアスの可能性)
- Astraのコストは自動キャッシュ分を割引せず算出(実際より高めの見積もり)
- 全モデル中程度推論設定で統一
- 物体のリセットは手作業で実施
まとめ
- GPT-6 Astraは物体把持・移動タスクでFableシリーズを大きく上回る性能
- パズルタスクでは全モデルが課題を残すため、今後の改善余地
- コスト・速度・成功率でAstraの優位性が明確
- 人手による評価やリグ環境の違いなど、完全な条件一致ではない点に留意が必要