世界を動かす技術を、日本語で。

オーパス5が現在、人工分析知能リーダーボードで第1位です

概要

Artificial Analysis Intelligence Index v4.1 は、9つの評価指標を用いてAIモデルの知能や性能を総合的に評価。 コスト、速度、応答性、オープン性 など多角的な指標で比較可能。 AA-Briefcase EloAA-Omniscience Index など、独自の知識・推論評価も導入。 モデルの商用利用可否やパラメータ数 も明示。 各評価指標の詳細は Intelligence Index methodology で確認可能。

Artificial Analysis Intelligence Index v4.1 の概要

  • Artificial Analysis Intelligence Index v4.1 は、AIモデルの総合的な知能評価指標。
  • 評価には GDPval-AA v2𝜏³-BankingTerminal-Bench v2.1SciCodeHumanity's Last ExamGPQA DiamondCritPtAA-OmniscienceAA-LCR の9つを採用。
  • 推論モデル は電球アイコンで識別。
  • 各評価の詳細や実施方法は Intelligence Index methodology で解説。

指標の詳細

  • AA-Briefcase Elo :知識作業ベンチマーク。分析品質Elo、プレゼンElo、ルーブリック合格率を統合した指標。
    • ルーブリック合格率は合成対戦方式でEloに変換。
    • 信頼区間は0でクランプ。
  • AA-Omniscience Index :知識の信頼性と幻覚(誤答)を評価。
    • 正答に報酬、幻覚にペナルティ、無回答は減点なし。
    • スコア範囲は-100~100、0は正答と誤答が同数を示す。

オープン性・商用利用

  • Openness Index :モデルのオープン性を0~100で評価。高スコアほどオープン。
  • モデル重みの公開状況商用利用制限 も明示。

コスト・価格指標

  • タスクごとの平均コスト (USD)。入力、キャッシュヒット、キャッシュ書き込み、推論、回答トークン価格を反映。
  • キャッシュヒット価格 :APIプロバイダーごとに異なるキャッシュ料金体系。
    • Anthropic:キャッシュ書き込み・TTL別料金
    • Google Vertex/Gemini:キャッシュストレージ時間課金
    • OpenAI/DeepSeek:基本的にヒット料金のみ
  • 出力トークン単価 もUSD/100万トークンで表示。

トークン使用量・速度・応答性

  • 1タスクあたりの平均出力トークン数 を算出。
  • コンテキストウィンドウ :入力+出力トークンの最大合計数。RAG用途で重要。
  • 出力速度 :1秒あたりの出力トークン数。高いほど高速。
  • 平均デコード時間 :1タスクあたりの平均処理時間(分)。
  • 初回応答トークンまでの遅延 (秒):推論モデルの「思考」時間含む。
  • エンドツーエンド応答時間 :500トークン出力にかかる総時間。

モデル規模(オープンウェイトモデル限定)

  • 総パラメータ数 :学習時に調整された重み・バイアスの合計(十億単位)。
  • 推論時アクティブパラメータ数 :Mixture of Experts(MoE)モデルでは一部のみ活性化。Denseモデルは全パラメータ活性化。

評価指標の活用と比較

  • モデルごとの知能・コスト・速度・応答性 を多角的に比較可能。
  • 業務自動化や知識作業AI の選定指標として活用。
  • 各評価の詳細や評価方法 は公式メソドロジーを参照。

まとめ

  • Artificial Analysis Intelligence Index v4.1 は、AIモデルの性能・コスト・オープン性・応答性を総合的に評価するための最新指標。
  • 独自ベンチマーク透明な評価基準 で、用途に応じた最適なAIモデル選定をサポート。

Hackerたちの意見

あまり興奮しすぎないで、インテリジェンスとコストのマトリックスを見てみてね: https://artificialanalysis.ai/models?intelligence-index-toke...

5.6 Sol(マックス)がこれらの中で一番安いのは驚きだね。出力もかなり良いのに。

Maxはかなりの追加推論があるね。高い設定だと、どれだけタスクを解決できないのか気になるな。多分、かなりコストが安く済むんじゃないかな。

その中の一つに「AA-全知指数」があるのが面白いね。AA-全知指数(高いほど良い)は、知識の信頼性と幻覚を測るんだ。正しい答えには報酬を与え、幻覚にはペナルティがあり、答えを拒否してもペナルティはない。これはパラメータのサイズや密度の良い指標になりそうで、ランキングはこんな感じ:Claude Fable 5(フォールバックあり)、Gemini 3.1 Pro Preview、Claude Opus 5(マックス)、Grok 4.6(高)、Gemini 3.6 Flash、GPT 5.6 Sol(マックス)。Gemini 3.xは「大きなモデルの匂い」がすると思ってた。

Gemini 3.1 Proは知識タスクには本当に良いよ。Googleはそこではうまくやってるし、Gemini Flash 3.6の画像分析も solid。コーディングやエージェント的なことにはちょっと足りないけどね。

ちょっと疑問だな。特に3.6 Flashが24で、Solが22の時に。3.x Flashモデルは単一のTPU 8iに収まると思われてたし、そのリストの中では234.7t/sって異常に高い。Solの64.4t/sやOpusの56.3t/sと比べてもね。3.1 Proも他のモデルよりずっと高い113.9t/sだし。AA-Omniscience Accuracyは君の期待により合ってると思う。61%の超サイズのFableの後に、Solや5.5、Opusみたいな大きなフロンティアモデルが続く感じ。Flashもその中に入ってる。Geminiは特に一般知識を運用コストに焦点を当ててるから、コーディングベンチマークで最高得点を取ることよりもね。Domain Score (Normalized)に行くと、Geminiモデルはソフトウェアでは競争力が劣ってるのがわかるよ。そこでSolはヘルスの6からソフトウェアの71に上がるんだ。

グラウンディングもかなり関係してると思う。Googleはその点で素晴らしい仕事をしてるよ、明らかに理由があるからね。

競争が激しい中での#1は、検閲を避けるために気を使わなきゃいけないと、あまり役に立たないよね(「セーフガード」)が、拒否されたり別のモデルに落とされたりするから。だから、ほとんどClaudeを使わなくなったよ(レガシーワークフローの一部を除いて)。信頼性は、57じゃなくて61を取るよりも重要だから。私にとってClaudeは、検閲や本人確認のせいで最も妥協された信頼できないモデルだと思う(私は個人的には経験してないけど)。最新リリースのためにやった微妙なベンチマックスは、全然価値がないよ。

何を聞いてるの?そんなに頻繁に検閲に引っかかるなんて。

そうだね。2週間前にClaude Maxのサブスクリプションをキャンセルしたんだけど、Anthropicが日常生活をめちゃくちゃにしようとしてる感じがしたから。彼らのリードがかなり重要にならない限り、戻ることはないかな。

オンラインのチャッター(例えば「制限の方がいい」とか「モデルの方がいい」とか)が、Anthropicにお金を払わないっていう自分の原則を再評価させるたびに、モデルカードを見に行くんだ。それが原則への信念を強めてくれる。なんでAnthropicはこの自動/サイレントダウングレードにそんなにこだわってるんだろう? 拒否よりも自動的にロボトミーされることを好むユーザーがいるの? 最初の反発から何も学んでないのかな?

Claude Opus 5.0に、PFAASのためのグローバルAPIキーを使ってテスト環境にいくつかのウェブアプリケーションをデプロイし、データをインポートするように指示したんだけど、グローバルAPIキーを使うのに抵抗があったんだ。セキュリティの問題が彼の感覚に引っかかるみたい。Opus 4.5、4.6、4.7、4.8、Fableでは問題なくこの作業をやったことがあるし、Codex 5.4、5.5、Sol 5.6でも問題なかった。Opus 5は生産的になるには慎重すぎるな。もっと調整が必要だ。

Hacker Newsで議論の続きを見る