世界を動かす技術を、日本語で。

DeepSeek V4 フラッシュ 0731

2026年8月8日原文(arcprize.org)

概要

  • DeepSeek V4 Flash 0731 は、2026年7月31日にリリースされた大規模言語モデル
  • ARC-AGI-1 Semi-Private で89.0%、 ARC-AGI-2 Semi-Private で61.4%の高スコアを記録
  • タスクごとのコストは $0.02~$0.04 と低価格
  • 3種類の推論バリアント を提供し、多様な難易度の課題に対応
  • ベンチマークごとの詳細なパス/フェイルデータを公開

DeepSeek V4 Flash 0731の概要

  • DeepSeek V4 Flash 0731 は、DeepSeek社が開発した最新の大規模言語モデル

  • リリース日: 2026年7月31日

  • 主な評価指標: ARC-AGI-1 Semi-Private で89.0%、 ARC-AGI-2 Semi-Private で61.4%のスコア

  • タスク実行コスト: ARC-AGI-1は1タスクあたり$0.02、ARC-AGI-2は$0.04

  • 3つの推論バリアント (Max, High, Low)を用意し、精度とコストのバランスを調整可能

    • Max: ARC-AGI-1で89.0%、ARC-AGI-2で61.4%
    • High: ARC-AGI-1で87.0%、ARC-AGI-2で56.0%
    • Low: ARC-AGI-1で84.0%、ARC-AGI-2で46.0%
  • ARC-AGIベンチマーク におけるパフォーマンスを詳細に公開

ベンチマーク評価詳細

  • ARC-AGI-2 Public Eval :120タスクでパス/フェイルを公開

    • 各タスクごとに Max/High/Low バリアントの成否を一覧化
    • タスク例: 0934a4d8, 135a2760, 136b0064 など
    • 各バリアントの強み・弱みを可視化
  • ARC-AGI-1 Public Eval :400タスクでパス/フェイルを公開

    • 多様な問題タイプに対する 一貫した高精度
    • 難易度や推論バリアントによる成績の違いを明確化

価格とパフォーマンス

  • 低コストかつ高精度 なAI推論環境
    • ARC-AGI-1:1タスクあたり $0.02
    • ARC-AGI-2:1タスクあたり $0.04
  • 用途や予算に応じてバリアントを選択 できる柔軟性

推論バリアントの特徴

  • Maxバリアント :最高精度を追求、コストはやや高め

  • Highバリアント :バランス型、精度とコストの最適化

  • Lowバリアント :コスト重視、精度はやや低下

    • 各バリアントは タスクの難易度や目的に応じて使い分け 可能

結論と活用ポイント

  • DeepSeek V4 Flash 0731 は、 高精度・低コスト・多段階推論 を兼ね備えた最新モデル
  • 教育、研究、産業用途 など幅広い分野での応用が期待
  • ベンチマークデータの透明性 により、導入前の評価や比較が容易

Hackerたちの意見

Kimi K3は1ヶ月前には面白いモデルだったのに、今じゃ同じパフォーマンスが1/20の価格で手に入るなんて。進化が早すぎるよね。

そうだね、ベンチマークがあんまり役に立たなくなったか、V4 Flashが本当にすごいモデルなんだと思う。

でも、価格が下がってないから誰も興味を示さないみたい。オープンルーターでは、Kimiのライセンスのせいで全プロバイダーがまだ3ドル/15ドルなんだ。 https://openrouter.ai/moonshotai/kimi-k3#providers

本当の質問: 毎日の変化についていきながら、実際に作業するための時間も確保している人っているの?AIの進展に注意を払う価値があるかどうか、もう限界に達したように思える。

あんまり長くはないみたいだけど、Deepseekがもうすぐ大幅な値上げをするって言ってる。スケーラブルなAPI市場をつかむ直前なのに、そんなことしない方がいいと思うんだけど。

発売以来ずっと使ってるけど、要するに「ほぼ全部に使えるくらい良いし、コストも気にしなくていい」って感じかな。Oh My Piで動かしてて、もう一つのインスタンスを「アドバイザー」として使ってるんだけど、5〜6セッション(実質12ストリーム)でも1日5ドル以上使うのが難しいくらい。OpenCode Goは一時的にダブルリミットがあるから、10ドルで実質140ドル分のトークンが使えるんだ。普通の使い方でその金額を使い切る人がいたら、ちょっと驚くかも。複数のセッションを動かしてもね。Claude Maxのサブスクリプションも持ってるけど、ほとんど使ってない。モデルが強くなってるのに、制限や使用を気にしなきゃいけないのは後退してる気がする。これだけのコストで知能を使えるのは(SOTAじゃなくても)新しい使い道がたくさん開けるのが魅力だよね。CIでテスト失敗したら、ボットに自動で修正案を提案させたり、テストカバレッジが低すぎたら、プルリクエストごとにCIで自動生成したり!サーバーログの監視や継続的なセキュリティ監査、受け取った例外の調査も可能になる。SNSのフィードを自動でフィルタリングして再ランク付けさせて、アルゴリズムを自分で操れるようにしたいな。もしかしたら、予算がすごい人たちはもうやってるかもしれないけど、私たちにとっては本当にワクワクするリリースだよ!

でもDeepSeekは、将来的にAPIの価格を大幅に引き上げる警告を出してるよ。

SOTAじゃなくても、LMMを使ってる99.99%の人はそもそもSOTAなんて必要ないと思う。

自動的にソーシャルメディアのフィードをフィルタリングして再ランキングすることを考えてるんだ。そうすれば、アルゴリズムを自分の思い通りに操れるから。これまであんまり考えてなかったけど、AIがソーシャルメディアを破壊してしまう技術になるかもしれないね。FBやIGみたいなものの価値提案は、ネットワーク効果だよね。プラットフォームはユーザー生成コンテンツから価値を引き出すわけだ。ユーザーが価値を生み出してるから、ウィキメディア財団みたいにユーザーがプラットフォームを所有すべきだと思うんだ。フェデレーションはHNで人気のある考えだけど、正しい問題に対して単に間違った解決策だと私は思うようになった。とにかく、これらのソーシャルメディア企業が収益を上げる方法は、エンゲージメントのためにフィードを最適化することだよね。みんなもそれを知ってるから、怒りを煽ることでオーディエンスを作ろうとする人がいる。で、より多くの時間を費やすことで、広告収入も増える。でも、AIがすべての投稿を吸い上げて、フィルタリングしてランキングできるようになったらどうなる?エンゲージメントと広告モデルが崩壊するよね。それに反対するつもりはないよ、正直言って。AIから生まれる数少ない良いことの一つかもしれない。

これに使うのに最適なハーネスはどれ?

(ほぼ)すべてに使えるほど十分良いってことは、あなたの場合は何なの?

$5/日が関係ないってどういうこと?月150ドルの範囲でGPT 5.6 Solのほぼ無制限使用ができるのに、同じ値段でずっと弱いモデルを使う理由は何?

Hacker Newsで議論の続きを見る