世界を動かす技術を、日本語で。

Kimi K3 (2.8T)を1トークン/秒でMacBook Pro上で、4つのSSDからストリーミング

2026年9月9日原文(github.com)

概要

  • Kimi K3 (2.8兆パラメータMoEモデル)の ローカル実行 に関する詳細なベンチマークと運用ノウハウ
  • Deltafin エンジンによる完全な品質維持と高速化の両立の実験
  • MacBook Pro M5 Max(128GB)4台のSSD での実測結果とボトルネック分析
  • 導入・アップグレード・利用方法、 OpenAI互換APIサーバ の構築手順を網羅
  • 品質保証・速度最適化・研究的意義 の両立を目指すプロジェクトの理念

Kimi K3ベンチマークと実験概要

  • Kimi K3 は2.8兆パラメータ、専門家重み1.45TBを持つ大規模MoEモデル
  • M5 Max MacBook Pro(128GB RAM) 上で、 4台のSSD から専門家重みをストリーミング
  • 512トークン生成時のデコード速度: 1.00 tok/s (128トークン時は1.13 tok/s、公開17トークンプロンプトで0.96 tok/s)
  • 最初のトークン出力までの遅延 :512トークンプロンプトで約6.3分(原因はprefill処理の8倍リード、修正予定)
  • ドライブ数によるスループット :1台で4台の約52%、2台で約73%、3台で約90%(各層16回読みの最遅ドライブが律速)

Deltafinの特徴と品質保証

  • Deltafin はKimi K3の全専門家・全パラメータを一切省略せず実行
  • Moonshot が公開した重み・品質を完全維持、速度向上は品質低下を伴わないことが絶対条件
  • ドラフトモデル(DSpark, Qwen) による先読み高速化も、K3本体が必ず検証・承認
  • 他プロジェクトでは重みを3bit圧縮等の手法で速度向上を図るが、Deltafinは「無加工・無妥協」を貫く

インストール・アップグレード手順

  • インストール手順

    • git clone https://github.com/gavamedia/deltafin.git
    • cd deltafin
    • cargo build --locked --release
    • モデル本体(1.7TB)をダウンロード:./target/release/deltafin setup --full
      • ストリーミング版(215GB~、初回遅いがキャッシュ蓄積で省容量運用も可):./target/release/deltafin setup --stream
    • DSparkはデフォルトで同梱、Qwen(補完高速化用)はオプションで追加可能
  • アップグレード手順

    • ./target/release/deltafin upgrade(モデル・キャッシュは維持、バイナリのみ再構築)
    • ブランチ状態がクリーンであることを確認(git status --short)

コマンドライン・APIサーバ利用法

  • コマンドライン利用例

    • チャット: ./target/release/deltafin run --chat --prompt "土星の三大衛星は?"
    • 生テキスト補完: ./target/release/deltafin run --prompt "The capital of France is" --max-new 17
    • 統計付き: --statsオプション追加
  • OpenAI互換APIサーバ

    • 起動: ./target/release/deltafin serve --host 127.0.0.1 --port 8000
    • cURL例:
      curl http://127.0.0.1:8000/v1/chat/completions \
        -H 'Content-Type: application/json' \
        -d '{"model":"deltafin-kimi-k3","stream":true,"messages":[{"role":"user","content":"Hello!"}]}'
      
    • サーバはOpenAI APIの厳密なサブセットを実装、チャット履歴・キャッシュ・速度最適化も自動対応

研究的意義とプロジェクト理念

  • Kimi K3 は本来16ノード・4.8TB VRAMクラスのインフラを想定
  • 家庭用ハードウェア (例:$15,000程度の構成)で「どこまで動かせるか」の実験・知見蓄積が目的
  • 品質を一切妥協しない速度最適化 の追求、1%の改善も貴重な研究成果
  • 他プロジェクトの「圧縮・近似」路線とは異なり、「物理限界までの忠実再現」に価値
  • 得られた知見は他のAIプロジェクトや自作AI運用にも波及効果

参考・クレジット

  • Moonshot AI (K3モデル公開)、 Inferact (DSpark)、 vLLMチーム (K3統合・キャッシュ研究)など多数の先行成果
  • Deltafinのネイティブランタイム・検証・スケジューリング・状態管理は独自開発
  • 詳細なドキュメント・API仕様・パフォーマンス再現手順・プラットフォーム対応状況を同梱

このドキュメントはKimi K3の ローカル実行・高速化・品質保証 に関する最先端の知見をまとめたものです。 自己ホストAI大規模モデル運用 に興味のある先端ユーザー・研究者に最適なリファレンス。

Hackerたちの意見

それ、次元が違うマゾヒズムだね。

それとmacOS主義もね。

『銀河ヒッチハイクガイド』のディープ・ソートを思い出すな。

5年前にこの技術がこのスピードであったら、きっとめちゃくちゃ役立つ革命的なものとして見られていたんだろうな。もしLLMがもっと能力があっても、劇的に遅かったら、使い方にどんな影響が出るんだろう?もっと考えを巡らせてプロンプトを作るようになるのかな、準備ももっと必要だろうし。

SSDの接続方法の説明を見逃しちゃった。もしかしてバカな質問かな。

SSDはThunderbolt 5のエンクロージャーを通じて接続されてるよ。俺はGen4のSSDが1つと、Gen5のSSDが3つ入ってるエンクロージャーを持ってる。仕様はここで見られるよ。https://github.com/argonautlabsai/deltafin/tree/main/k3-publ...

中くらいのプロンプトがたった11日で。

中くらいのプロンプトって、100万トークンってこと?

返答が終わる頃には、もう質問を解決してるよね。

1時間で3600ワード。

HNで星5つだけの#1投稿を見たことがない気がする。

速いSSDが助けになるかな?特に、eBayで中古のOptane SSDが手に入るけど、ちょっと高いんだよね。(遅い半端なコンシューマーNVMeよりも劣るような偽物のm.2じゃなくて)

Hacker Newsで議論の続きを見る