世界を動かす技術を、日本語で。

Grok 4.6が人工分析知能指数で61を獲得

概要

  • SpaceXAIのGrok 4.6 がArtificial Analysis Intelligence Indexで スコア61 を記録し、GPT-5.6 Solと同等の最前線に到達
  • エージェント性能 が特に優れ、コスト効率も高い
  • 前世代(Grok 4.5)から5ポイント上昇、Grok 4.3からは23ポイントの大幅な進化
  • 価格据え置きで高性能、競合モデルより大幅に安価
  • 長期的な知識作業 でも高い効率とパフォーマンスを発揮

Grok 4.6の知能指数・競合比較

  • Artificial Analysis Intelligence Indexでスコア61、GPT-5.6 Sol(最大値)と同等
    • Claude Opus 5(最大値:63)、Claude Fable 5(最大値:62)に次ぐ位置
    • Kimi K3をわずかに上回る性能
  • エージェント性能 が際立つ
    • GDPval-AA v2 Eloは 1753、Claude Opus 5の次点
    • Claude Fable 5、Qwen3.8 Maxと信頼区間が重なる
    • 𝜏³-Bankingで 50.7% (Qwen3.8 Maxの51.3%と並ぶトップ2)
    • Terminal-Bench v2.1で 88.4%、リーダーモデルと同水準
  • コストパフォーマンス
    • 入力/出力トークンあたり $2/$6 (Grok 4.5と同価格、競合の60%以上安い)
      • Claude Opus 5は$5/$25、GPT-5.6 Solは$5/$30
    • タスクごとのコストは $0.84、Kimi K3と同等で知能はやや上
    • 知能とコストのパレート最前線に位置
  • 長期的タスク(AA-Briefcase)
    • Elo 1577 でFable 5相当、Claude Opus 5ファミリーには及ばず
    • ターン数平均 約53回、入力トークン 約0.5B (Claude Opus 5は約103ターン/2.0Bトークン)
    • 少ないターン数と入力量でコスト優位性

モデル仕様・価格詳細

  • コンテキストウィンドウ:500kトークン (Grok 4.5から変更なし)
  • 価格:$2/$6 (入力/出力100万トークンあたり)
    • キャッシュヒットは $0.5/100万トークン (Grok 4.5の$0.3から値上げ)
  • 価格据え置きで知能向上、通常は最前線モデルで価格上昇が伴う中で異例

エージェント性能の詳細

  • 静的推論よりもエージェント型タスクで強み
    • GDPval-AA v2で Elo 1753、Claude Opus 5に次ぐ
    • 𝜏³-Banking(顧客対応・ツール利用型マルチターンタスク)でトップ2
    • Terminal-Bench v2.1(ターミナル操作タスク)でリーダー水準
  • 知識作業・顧客対応・ターミナル利用の全てで競争力
    • 価格との組み合わせで全エージェント評価でパレート最前線

コスト面の優位性

  • 世代を跨いでも価格据え置き
    • Grok 4.5から5ポイント向上、価格は $2/$6 のまま
    • タスクあたりコスト $0.84、トークン効率も良好
  • 競合比較
    • 同等スコアのClaude Opus 5は$5/$25、GPT-5.6 Solは$5/$30
    • 出力トークン価格が圧倒的に安価、推論負荷の高い業務で大きな差

長期的知識作業の効率

  • AA-Briefcase(長期知識作業ベンチマーク)でデビュー
    • Elo 1577 でFable 5級、Claude Opus 5ファミリーには及ばず
    • 採点・プレゼン・分析の全項目で安定した強さ
    • 平均53ターン/0.5Bトークンで解決、Claude Opus 5の半分以下
    • 長期タスクでの迅速な解答、コスト効率の高さ

参考リンク・詳細情報

Hackerたちの意見

Grok 4.5から、Cursorはフロンティアレベルのモデルに対してすごいお得なプランを提供してるよ。彼らのサブスクリプションは、OpenAIやAnthropicよりもずっと使える幅が広い。低いプランでも、彼らのファーストパーティモデル(GrokやComposer)でかなりのトークンを使えるし、比較的すぐに使い切ることはないよ。オーケストレーターや実装者タイプのセットアップと組み合わせれば、さらに使える幅が広がる。

どういう意味か説明してくれる?最近、OpenAIがやってる中毒性のあるリセットゲームのおかげで、フロンティアインテリジェンスでコスト効率のいいものが見つからないんだよね…

データをさらに引き出すってことだね、そうだね。

現在、Kimi K3をサブスクリプションプランで提供している西洋のプロバイダーは彼らだけだと思う。もしZDRのような補助プランがあれば、AnthropicをやめてKimiに移りたいな。

Grok 4.5はOpus >= 4.8と比べてどうなの?10%賢いモデルに2倍の料金を払う価値があると思ってる。インテリジェンスはそれだけ重要だよ(だって10%賢いと、平均して数時間の人間の時間を節約できるから)。

最後にCursorを使ったとき、彼らのサブスクリプションは月に約20ドルの使用をカバーしてたんだ。ChatGPTやClaudeみたいに、補助金付きのサブスクリプションモデルに切り替えたのかな?

Grok 4.5から4.6にかけて、キャッシュ読み取りの価格がほぼ倍になったみたいで、$0.30から$0.50になった。重いコーディングセッションを経験した中で、ほとんどの料金はキャッシュの読み取りと書き込みで、トークン請求の約80%を占めてるよ。

Grokは最高のモデルではないけど、まあまあだね。基本的な仕事は低価格でこなしてくれる。フロンティア数学を進化させることはできないと思うけど。

まだフロンティア数学を進化させるのは難しいだろうね。でも、今後のモデルでGrokが改善してほしいところがあったら教えてね!

使ってて全然イライラしないよ。複雑すぎず、サクサク動くし。GLM 5.2よりずっといい。コスパもかなり良い感じ。

SpaceXAIは、自前のコンピュータやデータセンター、そしてすぐにチップ製造工場を持つ唯一のフロンティアモデル企業だと思う。彼らは、より安価なトークンで同じような知能を持ち、さらに優れたハーネスやツールを使って先に行くんじゃないかな。Grokの構築は、個人的にはClaude Codeより2〜5倍速いと思う。

でも、EUVリソグラフィーは、現存する中で最も複雑な産業プロセスだから、使える歩留まりが得られるのは何年も先かもしれないし、もしかしたら永遠に無理かも。マスクが実際にこれらのファンが意味を持つとは思ってないと思うよ。ただ彼を盛り上げて気をそらせるためのものだよ。

Hacker Newsで議論の続きを見る