概要
- Codex Astra が全モデル中で最も安定した強さを発揮
- いずれのモデルも 初心者レベル を超えるプレイは見られなかった
- Grok はBrood Warを十分にプレイできず
- モデルによっては RTSをターン制ゲーム のように扱う傾向
- 今後もさらなるAIの 成長と課題の発見 が期待される
Brood War AIベンチマーク総評
- 全AIモデルは 初心者レベル のプレイにとどまる
- Codex Astra が他モデルを安定して圧倒
- Grok モデルはBrood Warをほとんどプレイできない
- 古いモデルは リアルタイム性 を理解できず、思考中に敗北する傾向
- 新しいモデルは 思考コスト を意識し始めたが、依然として課題が残る
リーダーボード結果
- Codex Astra / xhigh :勝率100%、コスト$10.54/ゲーム
- Codex Astra / medium :勝率88.9%、コスト$15.11/ゲーム
- Claude Fable :勝率83.3%、コスト$12.24/ゲーム
- Grok 4.6 は勝利数・プレイ内容ともに他と大きく劣後
プレイ観察と傾向
-
Codex Astra は「チーズ戦法」(奇襲)を早期に発見
- プローブによる妨害で相手AIの思考を遅らせる戦術が有効
- 持続的な生産や計画的な攻撃は苦手
- サブエージェント間の連携不足で、ユニットを個別に突撃させる初心者ミスが多発
- 指示を与えると戦略的な連携が向上
- 執念深さも見られ、拠点を失っても最後まで生き残る行動
-
Grok 4.6 は思考時間が長く、ほとんど行動できない
- 43分間でユニットを全く戦わせない試合も多数
- 状況観察と命令発行の制御ループが機能しないケースが多い
-
Claude Fable はゲーム進行を重視
- 経済やテックツリーの拡張を重視し、実際に勝利することも
- 複雑なビルドを試みるが、実行力に課題
共通の課題点
- どのモデルも 複雑な軍編成や防衛、具体的な戦略 の実行は不可
- 初心者による単純な戦術(例:フォトンラッシュ)にも勝てないレベル
- しかし、AIのプレイ観察は今後の進化を期待させる内容
各モデルのゲーム進行データ
- テクノロジー投資・ワーカー数・軍規模・建物数・資源残高 などの指標で比較
- Codex Astra と Claude Fable は類似した進行パターン
- Grok 4.6 は全体的に低水準
ゲーム終了タイミング
- Codex Astra :中央値8分10秒で終了、10分以内に約6割のゲームが終結
- Claude Fable :中央値10分37秒、10〜15分で多く決着
- Grok 4.6 :中央値9分15秒、10分以内に半数以上が終了
ベンチマーク運用方法
- 全モデル×設定 のラウンドロビン形式で対戦
- VM上で並列実行し、各試合のログとデータを保存
- 勝敗記録マトリクス にて、各モデルの直接対決結果を可視化
今後への展望
- 現状、AIは Brood War において初心者レベルを超えられていない
- 今後は 複雑な戦略・リアルタイム制御・連携強化 などが課題
- ベンチマークの深化とAIの進化に大きな期待