世界を動かす技術を、日本語で。

M4 Pro Mac Miniでのローカルモデルのセットアップ

2026年9月2日原文(lws.io)

概要

  • Apple Silicon搭載Mac miniでのローカルLLMサーバ構築例
  • クラウドAPI依存からの脱却とデータプライバシー確保
  • MoEモデル活用による効率的なメモリ運用
  • Tailscaleによるマルチデバイス連携とoMLXサーバ運用
  • モデルの入れ替えや運用コストの柔軟性

Apple Silicon Mac miniで構築するローカルLLMサーバ運用

  • M4 Pro Mac mini(48GB RAM) を用いたローカルLLMサーバ構成
  • Hermesエージェントのバックエンド やスマホからのクイックチャット対応
  • 30分程度のセットアップ時間 で運用開始可能な手軽さ

スタック構成

  • Qwen3.6-35B-A3B-OptiQ-4bit :深い推論や複雑なタスク向けメインモデル
  • Gemma-4-E4B-it-OptiQ-4bit :軽量・日常会話やフォーマット作業用モデル
  • oMLX :推論サーバ
  • Tailscale :Mac mini、iPhone、MacBookを繋ぐtailnet
  • Hermes :Mac mini上でバックエンド稼働、MacBookでデスクトップクライアント、iPhoneはTelegram経由で利用

日常運用アプリ

  • Apollo(iOS) :APIキー不要、Claude風の即時チャット
  • Pi :コーディングエージェントとして利用
  • Raycast AI :Mac上での軽作業
  • Hermes :全デバイスで会話履歴・スキルセット共有

ローカル運用のメリット

  • クラウドAPIは「借り物」 :価格変更・使用制限・モデル変更リスク
  • サブスク費用の高騰 :月額$200×2を消費、品質も不安定
  • データプライバシー問題 :第三者API送信は情報漏洩リスク
  • AI主権の確保 :政府規制やサービス停止リスクへの備え
  • コスト予測性 :ハードウェア購入+電気代のみ、推論コストは無料
  • 低レイテンシ :ネットワーク往復不要、即時応答
  • オフライン対応 :インターネット不要で稼働
  • レートリミットなし :APIの使用制限に縛られない

モデル選定とメモリ運用

  • MoE(Mixture-of-Experts)モデル の活用で効率的なメモリ消費
  • Qwen3.6-35B-A3B-OptiQ-4bit :4bit量子化で約20GB RAM消費
  • Gemma-4-E4B-it-OptiQ-4bit :約2.4GB RAM、軽作業向き
  • MoEモデルの特徴 :全パラメータ数と実際にアクティブなパラメータ数の違い
    • 例)Qwen3.6-35B-A3B:35Bパラメータ中3Bのみアクティブ、残りは待機
  • OSやコンテキストウィンドウ用にメモリを確保 :macOSは6-8GB、長文会話には8-16GB余裕を推奨

モデルファイルサイズ目安

  • 4bitモデル:パラメータ数(B)÷2~2.5=GB(例:35B→約17-20GB)
  • モデル+コンテキスト+OSで使用可能メモリを計算
  • MoEモデルは「アクティブパラメータ数」を確認

モデルの入れ替えと運用柔軟性

  • 新モデルへの切替は簡単 :~/models/にダウンロード→oMLXが自動検出→サーバ再起動

    • oMLX管理画面でHuggingFaceモデル検索・DL対応
    • Hermes、Pi、Raycast、Apolloの設定変更も容易
    • CLI経由でリモート操作・管理も可能(SSH対応)
  • ローカルモデルの品質向上 :1年前は微妙だったが、現在は実用レベル

    • コーディング・推論・ツール連携に強み
    • OptiQの4bit量子化で品質劣化は1-2pt程度、メモリ効率大幅向上

Tailscaleとネットワーク運用

  • Tailscaleで全デバイスをプライベートメッシュ化

    • Mac mini、iPhone、MacBookが同一ネットワーク
    • oMLXサーバはポート8000で待受、どの端末からも統一エンドポイント利用
    • デバイス間の設定ずれ・コンフィグドリフトなし
  • oMLXのKVキャッシュ永続化 :エージェントが過去コンテキストを高速復元

    • SSDキャッシュで再計算不要、Hermesなどのエージェント運用に最適

まとめと今後

  • Apple SiliconでのローカルLLM運用は実用段階
    • M4 Pro Mac miniで快適動作、モデル入替も容易
    • トークン単位課金なし、サードパーティ経由なしでセキュア
    • 新モデルも即時導入可能、コストはストレージのみ
  • 128GB M5 Max Mac Studioも注文済み
    • 他のApple Silicon端末でも運用可能、スペックに応じてモデル選択推奨

Hackerたちの意見

モデルのパフォーマンスについては言及されてないの?16GB RAMのミニPCでいろんなモデルを読み込めるけど、パフォーマンスはひどいもんだよ。みんながローカルモデルでどれくらいのパフォーマンスを得てるのか、気になるなぁ。

M4 Pro(48GB RAM)を使ってて、Gemma 4 26b a4bを52 tok/s、Qwen 3.5b a3bを72 tok/sで動かしてるよ。どっちも4bit量子化済み。これで十分だし、パフォーマンスもかなりいい感じ。GemmaモデルのMLXバージョンは使ってないけど、もし使ったら推論速度はもうちょっと良くなるかも。でも、コーディング機能には使わないかな。

それは違うよ。趣味でやるかプライバシーのためならいいけど、パフォーマンス目的ならフロンティアモデルのAPIを使った方がいいよ。ローカルでセットアップするのに何万もかかるものを、コスト以下で使えるんだから。

彼が説明したのと似たようなセットアップを、似たようなハードウェアで動かしてるよ。bifrostとllama swapを使ってるけど(tailscale最高)。ローカルモデルの使用は、個人のアプリのためのバッチ処理用だね。基本的にはメディアのパーソナライズされたレコメンダーで、何年もかけて集めたデータベースに基づいて、俺のためにコンテンツをキュレーションしてくれるんだ。だから、インタラクティブじゃないし、実行に数分かかっても気にしないよ。無料だし、マシンはただそこにあるだけだしね。M5 Max 128GBでqwen-coderとopencodeを使ってみたけど、claude codeと比べると痛い目にあった。claudeが計画して、qwenが実行(夜中に unattended、また遅いから)して、claudeがレビューするワークフローを設定したんだけど、これを何度もベンチマークした結果、claudeの方がqwenの問題を「修正」するためにもっとトークンを使っちゃった。生成されたコードは「十分良かった」けど、修正の価値はあったから、APIモデル(codexとclaude)を使ったコーディングタスクに専念してるよ。

正直、今の時点でローカルモデルを使う気にはならないな。5090を持っててQwen 3.8 27Bを快適に動かせるか、DSv4フラッシュを使ったDGX Sparksのペア、もしくは2x6000 RTX Blackwellsを持ってるなら別だけど。それがローカルモデルの愛好者たちが使ってるような rig だよ。GPUセットアップだと、一般的にシングルストリームで>100tpsの生成、プリフィルで>10k tpsが期待できるから、Claude codeよりもスムーズだし、ちょっと頭が悪い分はそれで補えるかな。とはいえ、MacのノートパソコンでLLMを動かせるのは本当にクールだよ。ただ、インタラクティブな使用に関しては、ほぼどの指標でもClaude Codeより良い体験はないと思う。プライバシーやガードレールを除いてね。

CPUを使うなんて想像できない…あ、2回やったことあるけど。もし在宅勤務で、プロンプトの合間に皿洗いをしながらなら、GPT-3みたいな結果が得られるかも。役に立ったかって言われると…まあ、役に立たなかったけどね。でも、Nvidia 3060なら不道徳な質問をかなり早く聞けたよ。

これは推定値です: https://tokenstead.ai/find/results?hardware_id=23&use_case=c...

私は512GB RAMのM3 Ultra Mac Studioを持っていて、ガスシティを運営しています。今日は初めてローカルモデル(GLM5.3 8ビット)がテストでFable5に匹敵しました。GLM-5.3-Flashの真の8ビット:ディスク上341GB、常駐328GB、46層に288のエキスパート、65秒でロード。 • 生成速度18.7トークン/秒、プロンプト35トークン/秒、デスク上で、トークンあたり$0のコスト。 • 約130GBの余裕を持って、1台のボックスで全エージェントシティを運営しています。 • レビューテスト:6つのP1欠陥をすべて検出、誤検出ゼロ、私たちが支払っているフロンティアモデルと同じスコア。 • CRMテスト:必要な11のレコードをすべて抽出、誤書きゼロ、45分、ローカルモデルとして初めて基準をクリア。 • 今日は131kトークンのウィンドウを提供中;モデル自体は1,048,576をサポート。4つの同時スロットに拡張しても、50GB以上の余剰RAMがあります。私のCTOはまだすべての推論をGLM5.3に移していませんが、現在Fableが処理している40%以上をローカルでルーティングすることを特定しました。しばらくの間、同時リクエストを行って応答を確認/比較します。

自分のCPUに合った設定を使っていますか?32GB RAMとIris Xe統合グラフィックカードのノートパソコンで、Qwen 3.8 27Bとsysl Intel最適化を使うと、11〜18トークン/秒の間で得られます。Vulkanバックエンドでも同じ結果ですが、時々メモリ消費のせいで変なセグメンテーションフォルトが起きることがあります。

Qwen3.8:27b-mlxを64GBのMBP M4で使ってるけど、最大42トークン/秒出せるし、だいたいは30トークンくらいの範囲だね。

このスレッドをQwen3.6-35B-A3Bでまとめてみたんだけど、1400 tpsのプレフィックスと60 tpsのコンプリーションが出たよ。パフォーマンスはかなり良いね。MacBook M5 Pro 64GBでoMLXを使ってる。

M4 Max/128GB RAMでローカルLLMを動かす最大の問題は、プリフィルのレイテンシーだね。最近、2台のDGX Sparksを手に入れたけど、すごくスムーズに感じるよ。

Hacker Newsで議論の続きを見る