概要
- DeepSeek V4 Flash 0731 は、2026年7月31日にリリースされた大規模言語モデル
- ARC-AGI-1 Semi-Private で89.0%、 ARC-AGI-2 Semi-Private で61.4%の高スコアを記録
- タスクごとのコストは $0.02~$0.04 と低価格
- 3種類の推論バリアント を提供し、多様な難易度の課題に対応
- ベンチマークごとの詳細なパス/フェイルデータを公開
DeepSeek V4 Flash 0731の概要
-
DeepSeek V4 Flash 0731 は、DeepSeek社が開発した最新の大規模言語モデル
-
リリース日: 2026年7月31日
-
主な評価指標: ARC-AGI-1 Semi-Private で89.0%、 ARC-AGI-2 Semi-Private で61.4%のスコア
-
タスク実行コスト: ARC-AGI-1は1タスクあたり$0.02、ARC-AGI-2は$0.04
-
3つの推論バリアント (Max, High, Low)を用意し、精度とコストのバランスを調整可能
- Max: ARC-AGI-1で89.0%、ARC-AGI-2で61.4%
- High: ARC-AGI-1で87.0%、ARC-AGI-2で56.0%
- Low: ARC-AGI-1で84.0%、ARC-AGI-2で46.0%
-
ARC-AGIベンチマーク におけるパフォーマンスを詳細に公開
ベンチマーク評価詳細
-
ARC-AGI-2 Public Eval :120タスクでパス/フェイルを公開
- 各タスクごとに Max/High/Low バリアントの成否を一覧化
- タスク例: 0934a4d8, 135a2760, 136b0064 など
- 各バリアントの強み・弱みを可視化
-
ARC-AGI-1 Public Eval :400タスクでパス/フェイルを公開
- 多様な問題タイプに対する 一貫した高精度
- 難易度や推論バリアントによる成績の違いを明確化
価格とパフォーマンス
- 低コストかつ高精度 なAI推論環境
- ARC-AGI-1:1タスクあたり $0.02
- ARC-AGI-2:1タスクあたり $0.04
- 用途や予算に応じてバリアントを選択 できる柔軟性
推論バリアントの特徴
-
Maxバリアント :最高精度を追求、コストはやや高め
-
Highバリアント :バランス型、精度とコストの最適化
-
Lowバリアント :コスト重視、精度はやや低下
- 各バリアントは タスクの難易度や目的に応じて使い分け 可能
結論と活用ポイント
- DeepSeek V4 Flash 0731 は、 高精度・低コスト・多段階推論 を兼ね備えた最新モデル
- 教育、研究、産業用途 など幅広い分野での応用が期待
- ベンチマークデータの透明性 により、導入前の評価や比較が容易