概要
主要AIモデルの知能や性能、コスト、速度などを独自評価に基づき比較。 各分野(コーディング、画像・動画、音声)ごとのリーダーボードを紹介。 モデルの「オープン性」や出力トークン数も評価対象。 現実的な価格やAPIの速度・レイテンシも比較。 多角的なAIモデル評価指標の概要。
主要AIモデルの知能評価
- Intelligence :主要AIモデルの 知能 を独自評価
- Coding Agent Index :エンドツーエンドのソフトウェア開発タスクにおける パフォーマンス・コスト・実行時間 評価
- コーディングエージェントの総合能力指標
画像・動画分野の評価
- Image & Video :Image ArenaとVideo Arenaリーダーボードの 上位モデル を紹介
- 95%信頼区間 付きの評価結果
- 画像生成、動画生成タスクの比較
音声分野の評価
- Speech :Text to Speech Arena、Speech to Text、Speech to Speechの 評価結果
- 音声合成、音声認識、音声変換モデルの性能比較
特定能力・業界別パフォーマンス
- Measures the performance :特定 能力 や 産業分野 ごとのモデルパフォーマンス測定
- 専門用途別の適合性評価
モデルのオープン性評価
- Openness Index :Artificial Analysis Openness Indexによる モデルの「オープン性」 評価
- 利用可能性や透明性を 各構成要素 ごとに分析
出力トークン数の比較
- Output Tokens :主要AIモデルの 出力トークン数 を独自評価
- モデルごとの生成量の違いを可視化
コスト・価格の比較
- Cost :主要AIモデルの 価格 と 実際の運用コスト を評価
- 現実的なコスト感覚の把握
APIパフォーマンスの比較
- Speed & Latency :ファーストパーティAPIの 速度 と レイテンシ 比較
- 実運用時のレスポンス性能を重視