概要
- Kimi K3 (2.8兆パラメータMoEモデル)の ローカル実行 に関する詳細なベンチマークと運用ノウハウ
- Deltafin エンジンによる完全な品質維持と高速化の両立の実験
- MacBook Pro M5 Max(128GB) と 4台のSSD での実測結果とボトルネック分析
- 導入・アップグレード・利用方法、 OpenAI互換APIサーバ の構築手順を網羅
- 品質保証・速度最適化・研究的意義 の両立を目指すプロジェクトの理念
Kimi K3ベンチマークと実験概要
- Kimi K3 は2.8兆パラメータ、専門家重み1.45TBを持つ大規模MoEモデル
- M5 Max MacBook Pro(128GB RAM) 上で、 4台のSSD から専門家重みをストリーミング
- 512トークン生成時のデコード速度: 1.00 tok/s (128トークン時は1.13 tok/s、公開17トークンプロンプトで0.96 tok/s)
- 最初のトークン出力までの遅延 :512トークンプロンプトで約6.3分(原因はprefill処理の8倍リード、修正予定)
- ドライブ数によるスループット :1台で4台の約52%、2台で約73%、3台で約90%(各層16回読みの最遅ドライブが律速)
Deltafinの特徴と品質保証
- Deltafin はKimi K3の全専門家・全パラメータを一切省略せず実行
- Moonshot が公開した重み・品質を完全維持、速度向上は品質低下を伴わないことが絶対条件
- ドラフトモデル(DSpark, Qwen) による先読み高速化も、K3本体が必ず検証・承認
- 他プロジェクトでは重みを3bit圧縮等の手法で速度向上を図るが、Deltafinは「無加工・無妥協」を貫く
インストール・アップグレード手順
-
インストール手順
- git clone https://github.com/gavamedia/deltafin.git
- cd deltafin
- cargo build --locked --release
- モデル本体(1.7TB)をダウンロード:
./target/release/deltafin setup --full- ストリーミング版(215GB~、初回遅いがキャッシュ蓄積で省容量運用も可):
./target/release/deltafin setup --stream
- ストリーミング版(215GB~、初回遅いがキャッシュ蓄積で省容量運用も可):
- DSparkはデフォルトで同梱、Qwen(補完高速化用)はオプションで追加可能
-
アップグレード手順
./target/release/deltafin upgrade(モデル・キャッシュは維持、バイナリのみ再構築)- ブランチ状態がクリーンであることを確認(git status --short)
コマンドライン・APIサーバ利用法
-
コマンドライン利用例
- チャット:
./target/release/deltafin run --chat --prompt "土星の三大衛星は?" - 生テキスト補完:
./target/release/deltafin run --prompt "The capital of France is" --max-new 17 - 統計付き:
--statsオプション追加
- チャット:
-
OpenAI互換APIサーバ
- 起動:
./target/release/deltafin serve --host 127.0.0.1 --port 8000 - cURL例:
curl http://127.0.0.1:8000/v1/chat/completions \ -H 'Content-Type: application/json' \ -d '{"model":"deltafin-kimi-k3","stream":true,"messages":[{"role":"user","content":"Hello!"}]}' - サーバはOpenAI APIの厳密なサブセットを実装、チャット履歴・キャッシュ・速度最適化も自動対応
- 起動:
研究的意義とプロジェクト理念
- Kimi K3 は本来16ノード・4.8TB VRAMクラスのインフラを想定
- 家庭用ハードウェア (例:$15,000程度の構成)で「どこまで動かせるか」の実験・知見蓄積が目的
- 品質を一切妥協しない速度最適化 の追求、1%の改善も貴重な研究成果
- 他プロジェクトの「圧縮・近似」路線とは異なり、「物理限界までの忠実再現」に価値
- 得られた知見は他のAIプロジェクトや自作AI運用にも波及効果
参考・クレジット
- Moonshot AI (K3モデル公開)、 Inferact (DSpark)、 vLLMチーム (K3統合・キャッシュ研究)など多数の先行成果
- Deltafinのネイティブランタイム・検証・スケジューリング・状態管理は独自開発
- 詳細なドキュメント・API仕様・パフォーマンス再現手順・プラットフォーム対応状況を同梱
このドキュメントはKimi K3の ローカル実行・高速化・品質保証 に関する最先端の知見をまとめたものです。 自己ホストAI や 大規模モデル運用 に興味のある先端ユーザー・研究者に最適なリファレンス。