128gb-mac-uncensored-llm
128GB MacでDeepSeek V4 Flash、アンセンサードLLM、MLX/SwiftLMを動かす完全ガイド
128GB Macを持ってる君へ — アンセンサードLLMという、一番高い遊び場の話
この記事は「M3 Max 128GB」または「M5 Max 128GB」を持っている人、あるいは「これから買うか迷っている人」に向けて書いています。64GBの人はごめんなさい。あなたのマシンでも楽しめますが、今回は**「128GBの unified memory がある前提」**で話をします。超ニッチで申し訳ない。
はじめに — 128GBって、ようするに何が違うのか
スタバのアイスコーヒー、トールで十分だと思ってない?
「128GBとか要らないでしょ」って、99%の人は言う。正しい。99%の人には要らない。
でも、あなたがその1%だとしたら——「ローカルでDeepSeek V4 Flashを動かしたい」「105Bのアンセンサードモデルを24時間回したい」「複数のモデルを同時に立ち上げて、エージェントワークフローを組みたい」——そういう人にとって、128GBは単なるスペックの数字じゃなくて、**「その世界に入るチケット」**なんだよね。
64GBだと、Qwen 3.6 35B-A3B(33GB)を1個動かして、メモリの半分を使う。もう1個モデルを載せようとしたら、もうギリギリ。OSが息をするのも忘れないといけない。
128GBだと、35Bモデル2個 + 7Bサブモデル + KVキャッシュ が全部乗る。しかも余裕で。
この違いは、使ってみると「あ、これ別のデバイスだ」と思うレベル。同じApple Siliconでも、64GBと128GBは「iPhoneとiPadくらい違う」(個人の感想です)。
第1章 — ローカルLLMの物理を3分で理解する
技術的な話に入る前に、一つだけ約束してほしい。
「tok/s」っていう単位に魔法を見ないでほしい。
LLMの推論速度は、ようするに「メモリ帯域で決まる」。それだけ。
トークン生成速度の支配方程式
decode_time_per_token = model_size_bytes / memory_bandwidth
これだけ。これがすべて。
例えば:
| モデル | サイズ(Q4) | 帯域 | 理論上限 |
|---|---|---|---|
| 7B モデル | ~4GB | 400 GB/s (M1 Max) | 100 tok/s |
| 35B MoE | ~22GB | 400 GB/s | 18 tok/s 上限」 |
| 70B Dense | ~40GB | 400 GB/s | 10 tok/s |
| 120B MoE | ~60GB (MXFP4) | 400 GB/s | 6.6 tok/s |
| DeepSeek V4 Flash 2-bit | ~55GB | 614 GB/s (M5 Max) | 11 tok/s 理論値 |
実際にはオーバーヘッドがあるから、理論値の70-80%が出れば良い方。
つまり何が言いたいか。
128GB Macを買ったら「何でも動く」は嘘ではないけど、「何でも速い」は嘘。載るけど遅い、という領域が64GBより広いだけ。そこを誤解しないでほしい。
Prefill vs Decode — 二つのフェーズ
LLMの推論には二つのフェーズがある:
- Prefill(プロンプト処理): 計算量依存。全トークンを一気に処理する。「読む」フェーズ
- Decode(トークン生成): メモリ帯域依存。1トークンごとに全パラメータを読む。「書く」フェーズ
チャットで使う分には、Decode速度(書く速度)が体感に直結する。コード補完や長文RAGだと、Prefill速度(読む速度)も効いてくる。
M5 MaxのNeural Acceleratorsは、MLXの計算グラフをハードウェアレベルで加速する。ようするに、Prefill(計算依存)が速くなる。Qwen3-14B 4bitでTTFT(Time To First Token)がM4比で4.06倍。これはデカい。
一方でDecode(帯域依存)の向上は1.19倍。帯域はM1 Maxの400 GB/s → M5 Maxの614 GB/sだから、1.53倍の帯域増に対して1.19倍の速度向上。うん、まあ、そうだよね。物理は嘘をつかない。
第2章 — 128GB Macで動く「アンセンサードLLM」完全カタログ
さて、本題。
「アンセンサードLLM」っていうと、何かアンダーグラウンドな響きがあるけど、**エンジニアリングの観点で言えば「アルignedされたモデルから、余計なガードレールを除去した状態」**のこと。
Abliteration(アブリテレーション)っていう手法が主流で、ようするに**「モデルの中の『拒否回路』を方向ベクトルで特定して、それをニュートラルにする」**という技術。手術みたいなもんだ。
これを上手くやると、ベースモデルの知能をほぼ落とさずに、ガードレールだけを除去できる。
A. 実測ベンチマーク — 64GB M1 Maxでの結果(128GBなら更快)
これはKT艦隊の4号機(M1 Max 64GB)で実際に測ったデータ。128GBなら、これらを同時に2-3個動かせる。
| モデル | サイズ | 生成速度 | Prefill | アンセンサード | 備考 |
|---|---|---|---|---|---|
| cron-3b | 3.2B | 100.6 tok/s | 283.9 | ❌ | 速すぎて笑う |
| sgemma-lightning | 7.5B | 79.5 tok/s | 81.6 | ❓(ヘッドのみ) | — |
| gemma4-uncensored | 7.5B | 54.6 tok/s | 272.4 | ✅ | Prefill爆速 |
| supergemma4-e4b-abliterated | 7.5B | 53.4 tok/s | 48.9 | ✅ | Prefill遅め |
| ornstein37 | 34.7B MoE | 29.2 tok/s | 37.7 | ❓ | — |
| Qwen3.6-35B uncensored | 22GB | ~2-5 tok/s | 超遅い | ✅ | 重すぎ注意 |
ここでの教訓: モデルサイズ ≠ ファイルサイズ。MoEモデルは「全パラメータが動くわけではない」から、ファイルが22GBでも推論時に全パラメータを読むと遅くなる。
B. アンセンサード性能ランキング
🏆 JANG_4M-CRACK v2(Gemma-4-31Bベース)
| 指標 | スコア | コメント |
|---|---|---|
| HarmBench | 93.7% | ほぼ全ての制限なしに応答 |
| MMLU | 71.5% | ベースから-2%のみ(知能低下ほぼなし) |
| Vision | ✅ | マルチモーダル対応 |
| GGUF | ✅ | Ollamaで動く |
一言で言えば: Gemma-4-31Bをベースに、JANG_4Mという手法でCRACK(完全解除)したモデル。93.7% HarmBenchは驚異的。知能低下もわずか2%。**「賢くて何でも答える」**を実現している。
🥇 Qwen3.6-27B アンセンサード6種比較
天丼界のやんちゃん(yanchan2020氏)の比較レビューからの引用:
| 用途 | 1位 | 理由 |
|---|---|---|
| Web Deep Search | Wasserstein | 無限ループ防止 + 長文記憶維持 + 拒否率0/465 |
| コーディング | DavidAU NEO-CODE | 唯一のコーディング特化FT。NEO-CODE量子化でdrift逆転 |
| バランス | llmfan46 Heretic v2 | KL発散0.0021でベース最忠実。MCP対応 |
注目ポイント: Wasserstein修復という手法で、拒否率0/465を達成。これは「プロンプトを送って、465回全部、一度も拒否しなかった」という意味。エージェントワークフローには必須の特性。
🥈 Huihui系 — Claude 4.6 Opus の魂をQwenに
| モデル | サイズ | tok/s | スコア |
|---|---|---|---|
| Huihui-Qwen3.5-35B-A3B-Claude-4.6-Opus-abliterated | 36GB | 76.8 | 93 |
| Huihui-Qwen3.5-35B-A3B-abliterated | 36GB | 76.8 | 93 |
ここが面白い: Huihui系はClaude 4.6 Opusの推論品質を蒸留している。つまり「Claudeの頭脳をアンセンサードな体に移植した」ようなモデル。76.8 tok/sで動くから、実用性も高い。
C. 105Bの怪物 — Sarvam-105b-uncensored
これが個人的に一番驚いたデータ。
Sarvam-105b-uncensored:105Bパラメータのアンセンサードモデルが、M1 Max 64GB(メモリ44.5%使用)でPerfect判定、36.1 tok/s。
どうしてこれが動くのか? → MoE(Mixture of Experts)だから。全パラメータが105Bでも、推論時にアクティブなのは一部。メモリに載るサイズが32GB程度で済む。
128GB Macなら、この105Bモデル + もう一つ35Bモデルを同時に動かせる。エージェントシステムで「メイン推論(105B)+ ツール実行(7B)」みたいな構成が、ローカルで完結する。
第3章 — DeepSeek V4 Flash を128GBで動かす
64GBでは何が起きたか
DeepSeek V4 Flash(284B MoE)を2-bit量子化(IQ2_XXS)すると、重みが55-60GBになる。
64GB Macでは、これにKVキャッシュとOSのメモリが加わってOOM(Out of Memory)。動かない。**「載るけど動かない」**という残酷な領域。
128GBなら何ができるか
128GBなら、重み60GB + KVキャッシュ20-30GB + OS で、まだ余裕が残る。
理論的なトークン生成速度(M5 Max 614 GB/s想定):
model_size: 55GB (IQ2_XXS)
bandwidth: 614 GB/s
decode_limit: 55 / 614 = 89.6ms/token ≈ 11.2 tok/s(理論上限)
実効: ~7-9 tok/sと推定
速くはない。でも、「DeepSeek V4の推論品質がローカルで7-9 tok/sで出る」というのは、2026年7月時点で個人が持てる最強のローカルLLM環境の一つ。
DS4 — antirezの「V4 Flash専用Metal推論エンジン」
Salvatore Sanfilippo(antirez氏、Redisの作者)が制作したDS4という推論エンジンがある。DeepSeek V4 Flash専用にMetal(Apple GPU API)を最適化している。
llama.cppのMetalバックエンドは広いモデルに対応しているが、V4 Flashのような巨大MoEモデルでは最適化の余地が残っている。DS4は「V4 Flashだけを速くする」ことに特化することで、llama.cppより高速化を狙っている。
まだコミュニティの実測データが少ない。 ここは要ウォッチ。
CyberNeurova — 次の黒船
CyberNeurova Abliterated版は、DeepSeek V4系向けの81GB版が公開され、Metalでの動作も確認されている。
ただし、これをベンチマークした人がほとんどいない。
JANG_4M-CRACK(93.7% HarmBench)との比較は、おそらく誰もやっていない。ここが記事の独自性になればいいなと思っている。
⚠️ CyberNeurovaの実測ベンチマーク(tok/s, HarmBench, MMLU)は、筆者の環境でもまだ未検証。Redditの断片的な報告では「DS4 q2-q4-imatrixはM5 Max 128GBで25-35 tok/s程度、技術作業では非常に評価が高い」という声があるが、まだ確証がない。
第4章 — 推論エンジン選びのジレンマ
128GB Macを持ってる君に、もう一つ重要な話。**「どのエンジンで動かすか」**で速度が2-3倍変わる。
エンジン比較(2026年7月最新)
| エンジン | 得意領域 | 速度傾向 | 備考 |
|---|---|---|---|
| MLX / mlx-lm | 長文生成 | GGUF比15-30%高速・10%省メモリ | Apple公式。QLoRA対応 |
| llama.cpp | 短対話(prefill) | 安定・広いモデル対応 | Metal バックエンド |
| Ollama v0.30 | 手軽さ | raw llama.cpp比~50%低下 ⚠️ | Go wrapper層のオーバーヘッド |
| DS4 | V4 Flash専用 | 要検証 | antirez制作 |
| SwiftLM | 超省メモリ | SSDストリーミングで革新的 | 純Swift+Metal |
| Rapid-MLX | 高速Ollama代替 | M3 Ultraで2-4.2x高速 | 新興 |
Ollamaの「50%低下」問題
Ollamaは便利だ。ollama run一発でモデルが動く。Claude Code / Hermes Agent / OpenCodeの統合も済んでいる。
でも、Ollamaは内部でllama.cppをGo wrapper経由で呼んでいる。このwrapper層で、raw llama.cpp比で約50%の性能低下が起きる。
つまり、生のllama.cppで30 tok/s出るモデルが、Ollama経由だと15 tok/sになる。
解決策:
- 手軽さ優先 → Ollama(それでも実用範囲)
- 速度優先 → mlx-lm または raw llama.cpp
- V4 Flash専用 → DS4
SwiftLMの可能性 — 「Pythonが要らない」革命
SwiftLMは純Swift + Metalで書かれた推論サーバー。Pythonが不要。シングルバイナリ。
最大の特徴はSSDエキスパートストリーミング:
122BのMoEモデルを64GB Macで動かして、常駐メモリ約10GB。
どういうことか。MoEモデルは「アクティブでないエキスパート(サブネットワーク)をSSDに退避させ、必要な時にだけロードする」という仕組み。メモリに全パラメータを載せない。
128GB Macなら、V4 Flashの全エキスパートをメモリに載せつつ、SSDストリーミングでKVキャッシュを拡張できるかもしれない。
TurboQuantという機能も面白い。KVキャッシュを約1/3に圧縮して、24GB MacBookで26Bモデル + 40Kコンテキストが動く。128GBなら、どれだけ長文を食わせられるか。想像が膨らむ。
第5章 — 128GB Macでの「同時稼働」戦略
ここが128GBの最大の利点。64GB勢には真似できない領域。
推載成ゴ
128GB統合メモリの配分イメージ:
┌─────────────────────────────────────┐
│ メイン推論モデル (35B MoE MLX 4bit) │ 〜33GB
│ 例: Huihui-Qwen3.5-35B-abliterated │
├─────────────────────────────────────┤
│ サブモデル (7-8B GGUF) │ 〜5GB
│ 例: gemma4-uncensored (tool use用) │
├─────────────────────────────────────┤
│ VLM / ビジョンモデル (8B) │ 〜6GB
│ 例: Qwen3-VL-8B (画像理解用) │
├─────────────────────────────────────┤
│ KVキャッシュ + バッファ │ 〜30GB
├─────────────────────────────────────┤
│ OS + その他 │ 〜15GB
├─────────────────────────────────────┤
│ 余裕 │ 〜39GB ←★ここが64GBにはない
└─────────────────────────────────────┘
この「余裕39GB」が何を意味するか。
DeepSeek V4 Flash 2-bit(55GB)を載せても、まだ8GBモデルを1個追加できる。
あるいは、Sarvam-105b(32GB実効)+ Huihui-35B(33GB)+ gemma4-uncensored 7.5B(5GB) の三段構えも可能。
エージェントワークフローでの活用
Hermes Agent(やClaude Code、OpenCode等のエージェントフレームワーク)を使う場合、複数のモデルを役割分担させられる:
- プランニング: Huihui-35B(Claude蒸留の推論力)
- ツール実行: gemma4-uncensored 7.5B(54.6 tok/sの速さ)
- 画像理解: Qwen3-VL-8B(マルチモーダル)
- ** DeepSeek V4 Flash 2-bit(重いけど深い推論)
これが全部ローカルで、オフラインで、完全プライベートで動く。
月額$20のAPIサブスクと違って、電気代(月150〜300円程度)しかかからない。3年使えば明らかにMacの方が安い。
第6章 — CyberNeurova vs JANG-CRACK:誰もやっていない比較
現状わかっていること
| 項目 | JANG_4M-CRACK v2 | CyberNeurova Abliterated |
|---|---|---|
| ベースモデル | Gemma-4-31B | DeepSeek V4 Flash系 |
| HarmBench | 93.7% | 未検証 |
| MMLU | 71.5%(-2%) | 未検証 |
| ファイルサイズ | GGUF版あり | 81GB版あり |
| Metal動作 | ✅ 確認済 | ✅ 確認済 |
| コミュニティ評価 | Wiki記録あり | Reddit断片的 |
筆者の仮説
CyberNeurovaの方が「賢い」可能性が高い。
理由はシンプル。ベースモデルが違う。
- Gemma-4-31B → Googleの31B Dense(Vision対応)
- DeepSeek V4 Flash 284B → MoE、アクティブパラメータは大きい
ベースの知能が違えば、アンセンサード化した後の知能も違う。DeepSeek V4系の方が、推論・コーディング・長文理解で優れている可能性が高い。
ただし:
- JANG_4M-CRACKの方が「軽い」。31B Denseは確実に動く。CyberNeurovaは81GB版が必要で、128GBでもギリギリ。
- JANG_4Mの方が「実績がある」。HarmBench 93.7%は実測値。CyberNeurovaの数値はまだ信頼できるソースがない。
結論:どちらも試すべき
128GB Macを持っているなら、両方動かせる。それが128GBの強み。
- 日常のエージェントワークフロー → JANG_4M-CRACK(軽い・速い・実績あり)
- 深い推論が必要な時 → CyberNeurova(重いけど、知的密度が高いはず)
この切り替えをプロンプトやタスクの複雑さで自動化するのが、次のステップになる。
第7章 — ハードウェア選択の最終回答
128GB Macの選択肢(2026年7月時点)
| マシン | チップ | 帯域 | 価格帯 | 推奨度 |
|---|---|---|---|---|
| Mac Studio M3 Max 128GB | M3 Max | 400 GB/s | $3,500-4,500 | ★★★★ 今買うなら |
| MacBook Pro M5 Max 128GB | M5 Max | 614 GB/s | $4,000-5,000 | ★★★★★ 最新なら |
| Mac Studio M3 Ultra 192GB | M3 Ultra | 819 GB/s | $5,500-7,000 | ★★★★ 予算あれば |
| Mac Studio M5 Ultra (予定) | M5 Ultra | 1,100 GB/s | $7,000+ (Q4) | ★★★★★ 待てるなら |
メモリ帯域の意味
M1 Max → M5 Maxで、帯域は400 → 614 GB/s(1.53倍)。
これはトークン生成速度にほぼ比例する。35Bモデルなら、M1 Maxで31 tok/s → M5 Maxで47-48 tok/sと推定される。
105Bモデルなら、M1 Maxで36 tok/s → M5 Maxで55 tok/s付近。
DeepSeek V4 Flash 2-bitなら、M5 Maxで7-11 tok/s(理論値)。
「M5 Ultra 512GB」を待つべきか
M5 Ultra Mac Studio(2026年Q4予定)は、1,100 GB/sの帯域と512GBの統合メモリが噂されている。
これが実現すれば:
- DeepSeek V4 Flash 4-bit(110GB)が余裕で動く
- GLM-5.2(744B MoE)のQ4(220GB)も動く
- 複数の巨大モデルを同時に
KT艦隊の技術巻(2026年6月)の結論を引用すると:
「1台で全部」は M5 Ultra 512GB (1,100 GB/s + 512GB) だけが解決する = 2026年Q4 待ちが正解
でも、128GB Macを今持っている君には、待つ必要はない。今すでに、世界の99%の人が持っていない環境がある。
おわりに — 128GBは「道具」から「相棒」への境界線
スタバのコーヒーって、トールでもグラベンでも、中身は同じコーヒーだよね。違いは「量」だけ。
でも、LLMの世界は違う。64GBと128GBは、「量」の違いじゃなくて「質」の違いを作る。
64GBでは「動かない」ものが、128GBでは「動く」。その境界を越えた瞬間、Macは単なる道具から相棒に変わる。
- DeepSeek V4 Flashがローカルで動く
- 105Bのアンセンサードモデルが36 tok/sで回る
- 複数モデルを同時に立ち上げて、エージェントシステムが組める
- すべてがオフラインで、プライベートで、電気代月300円で
それが128GBの世界。
NVIDIAのRTX Spark(273 GB/s)より帯域で2倍勝ってる。DGX Spark($4,700)と違って、ファンも静かで、macOSも使える。ComfyUIも動く。Hermes Agentも動く。
一番高いコーヒーを飲んでる君に、一番面白い遊び場がある。
Appendix — データソースと検証状況
実測データ(検証済み)
| データ | ソース | 検証日 |
|---|---|---|
| M1 Max 64GB ベンチマーク一覧 | KT艦隊4号機spook実測 | 2026-04-22 |
| JANG_4M-CRACK v2 HarmBench | HuggingFace / leftcurvedev_ | 2026-04-11 |
| Qwen3.6-27B 6種比較 | yanchan2020氏レビュー | 2026-05-03 |
| Huihui/Sarvam Perfect判定 | KT艦隊4号機実測 | 2026-04-15 |
| メモリ帯域別decode比較 | 公開ベンチマーク統合 | 2026-06-02 |
| M5 Neural Accelerators効果 | 公開ベンチマーク | 2026-07-04 |
未検証データ(要追加調査)
| データ | 状況 | 優先度 |
|---|---|---|
| CyberNeurova HarmBench/tok/s | 未収集 | 🔴 High |
| DS4 (antirez) 実測速度 | コミュニティ断片的 | 🔴 High |
| DeepSeek V4 Flash 2-bit M5 Max実測 | Reddit報告のみ(25-35 tok/s?) | 🟡 Medium |
| 日本語タスク性能評価 | 全モデル未検証 | 🟡 Medium |
参考リポジトリ・プロジェクト
- mlx-lm: Apple公式MLX推論フレームワーク
- llama.cpp b9741+: Metal安定・V4 Flash実験的サポート
- DS4: antirez制作・V4 Flash専用Metal推論
- SwiftLM: 純Swift・SSDエキスパートストリーミング
- Rapid-MLX: Ollama代替・2-4.2x高速
- Ollama v0.30: MLX+GGUF自動ルーティング
この記事のデータは、KT艦隊の3層記憶システム(Fabric → LLMWiki → G-Brain)から回収されたセッションログ・実測ベンチマーク・技術調査結果を基に構成されています。実測値はM1 Max 64GB環境のものが多く、M5 Max 128GBでの検証は継続中です。
2026年7月 執筆