概要
- オープンソースAIモデル の進化と巨大化
- Kimi K3 の登場と、その高性能・高コスト効率性
- AMD MI355X によるコストパフォーマンスの優位性
- ソフトウェア最適化 による性能向上事例
- 今後の AMDとCUDAの競争 の見通し
オープンソースAIモデルの進化とKimi K3の登場
- 近年、 DeepSeek V4-Pro や GLM5.2 など、オープンソースAIモデルの知能レベルがOpusに迫る進化
- Kimi K3 はFable/Sol並みの知能を持ち、オープンソースの新時代を象徴
- モデルの高性能化とともに、 パラメータ数とVRAM要件 も急増
- GLM5.2:753Bパラメータ
- DeepSeek V4-Pro:1.6Tパラメータ
- Kimi K3:2.8Tパラメータ(1.5TB超のVRAM必要)
ハードウェア選択とAMD MI355Xの優位性
- B200(8GPU)ノード ではKimi K3を収容不可
- B300(288GB VRAM/GPU) またはB200ノード2台(TP16)で対応
- AMD MI355X も288GB VRAMを搭載し、コストはB300の約2.4倍安価、B200の約1.7倍安価
- ハードウェアスペックはBlackwellに匹敵
- 課題は ソフトウェアサポート だが、Kimi K3はAMD向けにDay-0対応
ベンチマーク結果とパフォーマンス比較
- 1,024トークン入力/400トークン出力ベンチマークでの性能
- MI355X :952 tok/s/node、118 tok/s(シングルストリーム)
- B200 TP16 :498 tok/s/node(2ノード合計)、90 tok/s
- B300 :1,568 tok/s/node、172 tok/s
- パフォーマンス/コスト ($2.50/MI355X, $6.00/B300, $4.25/B200)
- MI355X:48 tok/s/$
- B300:33 tok/s/$
- B200:7 tok/s/$
- MI355X はB300に比べてコスト効率で圧倒的優位
ソフトウェア最適化の実際例
- Kimi K3は speculative decode による高速化が鍵
- CUDAでは問題なく動作、ROCmではNameError(top_k_renorm_prob未定義)発生
- 修正はPyTorch関数の追加のみで対応可能
- 最適化後、 シングルストリームで2.2倍、ピーク時で1.7倍の性能向上
- prefill(初期入力) 最適化も重要
- MI355Xはcold prefillでB300の2倍以上時間を要したが、カーネル側のshape調整で2~3倍高速化
今後の展望とまとめ
- MI355Xで 最高のパフォーマンス/コスト比 をほぼそのまま実現
- 案件特有のバグはあったが、GLM5.2よりは少なく、カスタムカーネル不要
- AMDでのSOTA達成が目前
- CUDAの優位性が薄れつつある 状況
関連記事
- WaferとTrueFoundry AI Gatewayの統合によるサーバレス推論環境
- GLM5.2をAMD MI355Xで2倍以上安価に高速提供した事例