世界を動かす技術を、日本語で。

ブリードウォー ベンチ

2026年9月19日原文(bw.swerdlow.dev)

概要

  • Codex Astra が全モデル中で最も安定した強さを発揮
  • いずれのモデルも 初心者レベル を超えるプレイは見られなかった
  • Grok はBrood Warを十分にプレイできず
  • モデルによっては RTSをターン制ゲーム のように扱う傾向
  • 今後もさらなるAIの 成長と課題の発見 が期待される

Brood War AIベンチマーク総評

  • 全AIモデルは 初心者レベル のプレイにとどまる
  • Codex Astra が他モデルを安定して圧倒
  • Grok モデルはBrood Warをほとんどプレイできない
  • 古いモデルは リアルタイム性 を理解できず、思考中に敗北する傾向
  • 新しいモデルは 思考コスト を意識し始めたが、依然として課題が残る

リーダーボード結果

  • Codex Astra / xhigh :勝率100%、コスト$10.54/ゲーム
  • Codex Astra / medium :勝率88.9%、コスト$15.11/ゲーム
  • Claude Fable :勝率83.3%、コスト$12.24/ゲーム
  • Grok 4.6 は勝利数・プレイ内容ともに他と大きく劣後

プレイ観察と傾向

  • Codex Astra は「チーズ戦法」(奇襲)を早期に発見

    • プローブによる妨害で相手AIの思考を遅らせる戦術が有効
    • 持続的な生産や計画的な攻撃は苦手
    • サブエージェント間の連携不足で、ユニットを個別に突撃させる初心者ミスが多発
    • 指示を与えると戦略的な連携が向上
    • 執念深さも見られ、拠点を失っても最後まで生き残る行動
  • Grok 4.6 は思考時間が長く、ほとんど行動できない

    • 43分間でユニットを全く戦わせない試合も多数
    • 状況観察と命令発行の制御ループが機能しないケースが多い
  • Claude Fable はゲーム進行を重視

    • 経済やテックツリーの拡張を重視し、実際に勝利することも
    • 複雑なビルドを試みるが、実行力に課題

共通の課題点

  • どのモデルも 複雑な軍編成や防衛、具体的な戦略 の実行は不可
  • 初心者による単純な戦術(例:フォトンラッシュ)にも勝てないレベル
  • しかし、AIのプレイ観察は今後の進化を期待させる内容

各モデルのゲーム進行データ

  • テクノロジー投資・ワーカー数・軍規模・建物数・資源残高 などの指標で比較
  • Codex AstraClaude Fable は類似した進行パターン
  • Grok 4.6 は全体的に低水準

ゲーム終了タイミング

  • Codex Astra :中央値8分10秒で終了、10分以内に約6割のゲームが終結
  • Claude Fable :中央値10分37秒、10〜15分で多く決着
  • Grok 4.6 :中央値9分15秒、10分以内に半数以上が終了

ベンチマーク運用方法

  • 全モデル×設定 のラウンドロビン形式で対戦
  • VM上で並列実行し、各試合のログとデータを保存
  • 勝敗記録マトリクス にて、各モデルの直接対決結果を可視化

今後への展望

  • 現状、AIは Brood War において初心者レベルを超えられていない
  • 今後は 複雑な戦略・リアルタイム制御・連携強化 などが課題
  • ベンチマークの深化とAIの進化に大きな期待

Hackerたちの意見

ベンチマークとは関係ないけど… スタークラフトが大好きなんだ。最初からプレイしてて、今の友達もその時代の人たちばっかり。ティーンエイジャーの頃に、ほぼ全大陸に広がった人たちと出会ったんだよね。ネットカフェで遊んでたけど、インターネットにはアクセスできなかったし、料金も違ったんだよね… あの頃が懐かしいな。みんなバックグラウンドが違ってて、サイバーカフェでスタークラフトをやってるただのプレイヤーだったし… 今は40代になって、数学の先生や歴史の先生、油田作業員、ソフトウェアプログラマー、プロゲーマー、弁護士なんかを知ってる… ハハ、考えるとすごいよね… みんなと話すし、なんて世界なんだろう。

後にはエミネムを聴いたり、暴力的なビデオゲームをプレイしたりもした。ほとんどの人は犯罪で起訴されたことなんてないし、誰かを虐待したことなんてないよ。

同意するよ。スタークラフトを初めてプレイしたのは、発売から約10年後のサマーキャンプだった。みんな頭のいい人たちがやってたから、私もやりたくなったんだ。いい決断だったよ、スタークラフトを通じて出会った人たちにはいつも感心してる。

バーニングマンでも、砂漠の真ん中に毎年スタークラフトのトーナメントを開催するキャンプがあるよ(見たこともないようなホコリまみれのセットアップで!) :)

昔のスタークラフトエルダークランナーたちに、最高の挨拶を送るよ :)

ああ、正直言ってプレイした時間は認めたくないくらい多いよ。バトルネットで10000回以上勝ったし…いくつかのアカウントのうちの一つだけでね :) SC2のベータ版が出たとき、50〜100ゲームくらいプレイしたけど、フルゲームは買わなかった。自分にとってはヘロインみたいなもので、もう自分のことをちゃんとしなきゃいけない大人だったからね。

同じく、ブリードウォーも少し復活してきてるね。大きなことではないけど。バトルネットのサーバーがちゃんと動いてるときは、週に数回はランク戦をプレイしてるよ。ボコボコにされるけど、それでも史上最高の競技ゲームの一つだと思う。

そうだね!若いって素晴らしいし、あの頃が一番良かったように思えるよね。

友達のバトルネットの古い仲間に連絡できたらいいのにな。

友達がGoBenchを作ったんだ。これはKataGoの対戦相手をEloの基準にして9×9の囲碁でLLMを評価するもの。そこで本当の能力の違いが見えるんだよね。Astra Maxが他のモデルを大きくリードしてるのがわかる。LLMを評価するのに戦略って面白い分野だと思う。

より良いベンチマークは、LLMにGOのAIを書かせて、それを比較することかもしれない。ただ、このゲームがLLMのトレーニングに含まれているかどうかでパフォーマンスに大きな差が出るんだ。一般的なLLMを直接これらのゲームをプレイさせるのは、キャパシティの無駄遣いだし、ベンチマックスのために奨励すべきじゃない。エンジンをプログラミングするのは、もっと一般的なスキルで、みんなが持っておくべきだと思う。エンジンのターゲットを厳密なサイクル予算を持つ特定の仮想マシンにするのも有用かも。例えば、実行が一定のサイクルを消費して、結果が特定のメモリアドレスから読み出されるとか(早期に終了した場合も含めて)。

現在、ランダムでみんなを打ち負かしてるボットがいるよ。今日、ArtosiscastsのYouTubeチャンネルで見たばかり。

Hacker Newsで議論の続きを見る