概要
- SpaceXAIのGrok 4.6 がArtificial Analysis Intelligence Indexで スコア61 を記録し、GPT-5.6 Solと同等の最前線に到達
- エージェント性能 が特に優れ、コスト効率も高い
- 前世代(Grok 4.5)から5ポイント上昇、Grok 4.3からは23ポイントの大幅な進化
- 価格据え置きで高性能、競合モデルより大幅に安価
- 長期的な知識作業 でも高い効率とパフォーマンスを発揮
Grok 4.6の知能指数・競合比較
- Artificial Analysis Intelligence Indexでスコア61、GPT-5.6 Sol(最大値)と同等
- Claude Opus 5(最大値:63)、Claude Fable 5(最大値:62)に次ぐ位置
- Kimi K3をわずかに上回る性能
- エージェント性能 が際立つ
- GDPval-AA v2 Eloは 1753、Claude Opus 5の次点
- Claude Fable 5、Qwen3.8 Maxと信頼区間が重なる
- 𝜏³-Bankingで 50.7% (Qwen3.8 Maxの51.3%と並ぶトップ2)
- Terminal-Bench v2.1で 88.4%、リーダーモデルと同水準
- コストパフォーマンス
- 入力/出力トークンあたり $2/$6 (Grok 4.5と同価格、競合の60%以上安い)
- Claude Opus 5は$5/$25、GPT-5.6 Solは$5/$30
- タスクごとのコストは $0.84、Kimi K3と同等で知能はやや上
- 知能とコストのパレート最前線に位置
- 入力/出力トークンあたり $2/$6 (Grok 4.5と同価格、競合の60%以上安い)
- 長期的タスク(AA-Briefcase)
- Elo 1577 でFable 5相当、Claude Opus 5ファミリーには及ばず
- ターン数平均 約53回、入力トークン 約0.5B (Claude Opus 5は約103ターン/2.0Bトークン)
- 少ないターン数と入力量でコスト優位性
モデル仕様・価格詳細
- コンテキストウィンドウ:500kトークン (Grok 4.5から変更なし)
- 価格:$2/$6 (入力/出力100万トークンあたり)
- キャッシュヒットは $0.5/100万トークン (Grok 4.5の$0.3から値上げ)
- 価格据え置きで知能向上、通常は最前線モデルで価格上昇が伴う中で異例
エージェント性能の詳細
- 静的推論よりもエージェント型タスクで強み
- GDPval-AA v2で Elo 1753、Claude Opus 5に次ぐ
- 𝜏³-Banking(顧客対応・ツール利用型マルチターンタスク)でトップ2
- Terminal-Bench v2.1(ターミナル操作タスク)でリーダー水準
- 知識作業・顧客対応・ターミナル利用の全てで競争力
- 価格との組み合わせで全エージェント評価でパレート最前線
コスト面の優位性
- 世代を跨いでも価格据え置き
- Grok 4.5から5ポイント向上、価格は $2/$6 のまま
- タスクあたりコスト $0.84、トークン効率も良好
- 競合比較
- 同等スコアのClaude Opus 5は$5/$25、GPT-5.6 Solは$5/$30
- 出力トークン価格が圧倒的に安価、推論負荷の高い業務で大きな差
長期的知識作業の効率
- AA-Briefcase(長期知識作業ベンチマーク)でデビュー
- Elo 1577 でFable 5級、Claude Opus 5ファミリーには及ばず
- 採点・プレゼン・分析の全項目で安定した強さ
- 平均53ターン/0.5Bトークンで解決、Claude Opus 5の半分以下
- 長期タスクでの迅速な解答、コスト効率の高さ
参考リンク・詳細情報
- 個別評価の詳細・ベンチマーク結果
- Artificial Analysis Intelligence Index公式ページ
- https://artificialanalysis.ai/models/grok-4-6