世界を動かす技術を、日本語で。

Qwen3.8 Maxがエージェンティックインデックスによって総合モデルの最高評価を獲得

概要

主要AIモデルの知能や性能、コスト、速度などを独自評価に基づき比較。 各分野(コーディング、画像・動画、音声)ごとのリーダーボードを紹介。 モデルの「オープン性」や出力トークン数も評価対象。 現実的な価格やAPIの速度・レイテンシも比較。 多角的なAIモデル評価指標の概要。

主要AIモデルの知能評価

  • Intelligence :主要AIモデルの 知能 を独自評価
  • Coding Agent Index :エンドツーエンドのソフトウェア開発タスクにおける パフォーマンス・コスト・実行時間 評価
    • コーディングエージェントの総合能力指標

画像・動画分野の評価

  • Image & Video :Image ArenaとVideo Arenaリーダーボードの 上位モデル を紹介
    • 95%信頼区間 付きの評価結果
    • 画像生成、動画生成タスクの比較

音声分野の評価

  • Speech :Text to Speech Arena、Speech to Text、Speech to Speechの 評価結果
    • 音声合成、音声認識、音声変換モデルの性能比較

特定能力・業界別パフォーマンス

  • Measures the performance :特定 能力産業分野 ごとのモデルパフォーマンス測定
    • 専門用途別の適合性評価

モデルのオープン性評価

  • Openness Index :Artificial Analysis Openness Indexによる モデルの「オープン性」 評価
    • 利用可能性や透明性を 各構成要素 ごとに分析

出力トークン数の比較

  • Output Tokens :主要AIモデルの 出力トークン数 を独自評価
    • モデルごとの生成量の違いを可視化

コスト・価格の比較

  • Cost :主要AIモデルの 価格実際の運用コスト を評価
    • 現実的なコスト感覚の把握

APIパフォーマンスの比較

  • Speed & Latency :ファーストパーティAPIの 速度レイテンシ 比較
    • 実運用時のレスポンス性能を重視

Hackerたちの意見

そのページ、https://artificialanalysis.ai/agents/coding-agents で「Qwen」が一度も言及されてないのは変だよね。今や「最高」って言われてるのに、なんでだろ?

異なるベンチマーク: > 人工分析エージェントインデックス:人工分析インテリジェンスインデックス(GDPval-AA v2、Tau³-Banking)のエージェント能力ベンチマークの加重平均を表す > 人工分析コーディングエージェントインデックスv1.3は、DeepSWE、Terminal-Bench v2、SWE-Atlas-QnAの3つのベンチマークを組み込んでいる。Qwen3.8 Maxはエージェントインデックスで55.4だけど、コーディングエージェントインデックスではテストされていないんだ。

確かに、このQwen 3.8 maxの特定ページには、そんな主張はないね。クリックベイトかな?

そのグラフによると、Grok 4.5が最もコストパフォーマンスが良さそうだね。

すべてのベンチマークを実行したわけじゃないみたい。AAエージェントインデックス(GDPval-AA v2、³-Banking)では最高だけど、コーディングインデックスではそうじゃない(DeepSWEが抜けてるし、Terminal-Bench v2.1はSolの90%に対して81%だし、SWE-Atlas-QnAも抜けてる)。

「人工分析」って言ってることそのままなのかな?ちょっと疑わしいけど、Qwenの大きいモデルにはすごく感心してるし、Kimiも少し触ってみて印象が良かった。深く掘り下げると質の低下を感じることがあるけど、それは非難じゃないよ。計算と質のトレードオフをうまくこなしてるみたいだし、オンプレミスの能力は本当に代えがたいね。この最適化を目指す中で生まれた革新もたくさんあるし、量子化や「蒸留」(明らかに狂牛病みたいなことなしに)もそう。中国はこの進展において貴重な存在だったと思う。直感的には、競争がなければLLaMaも存在しなかったんじゃないかな。

Qwen 3.8 27Bがめっちゃ楽しみ!ストリックスハローでのプレフィルが遅いのは残念だけど(約3-400)、エージェントタスクにはすごくいいモデルだよね。

どんなエージェント的なタスクに使ってるの?(例えば、どれくらい複雑なもの?)

Strix Haloでどうやって動かしてるの?ウェイトはまだ出てないよね?

35B-A3Bは、M4 Maxで動かすのがすごく楽だよ(プリフィルも生成もね)。

プレフィルはうまくキャッシュすれば生き残れるけど、問題はそのコンテキストだよね。Qwen 27はKVキャッシュにかなりのスペースが必要なんだ。128GBのHaloやSparkなら問題ないと思うけど、消費者向けやプロシューマー向けのGPUを使ってると、120kトークンごとに圧縮するのが本当に辛い。

オープンウェイトモデルがGPT5.6とほぼ同じ値段ってどういうこと?コストインデックスで$1.14対$1.23だし。モデルサイズの関係で自分のハードウェアで動かせないからプライバシーとか他の利点も得られないし、こんな状況じゃGPTから移る理由が見当たらないな。

Hacker Newsで議論の続きを見る