← Back to Home
テクノロジー ·

128gb-mac-uncensored-llm

128GB MacでDeepSeek V4 Flash、アンセンサードLLM、MLX/SwiftLMを動かす完全ガイド

128gb-mac-uncensored-llm

128GB Macを持ってる君へ — アンセンサードLLMという、一番高い遊び場の話

この記事は「M3 Max 128GB」または「M5 Max 128GB」を持っている人、あるいは「これから買うか迷っている人」に向けて書いています。64GBの人はごめんなさい。あなたのマシンでも楽しめますが、今回は**「128GBの unified memory がある前提」**で話をします。超ニッチで申し訳ない。


はじめに — 128GBって、ようするに何が違うのか

スタバのアイスコーヒー、トールで十分だと思ってない?

「128GBとか要らないでしょ」って、99%の人は言う。正しい。99%の人には要らない。

でも、あなたがその1%だとしたら——「ローカルでDeepSeek V4 Flashを動かしたい」「105Bのアンセンサードモデルを24時間回したい」「複数のモデルを同時に立ち上げて、エージェントワークフローを組みたい」——そういう人にとって、128GBは単なるスペックの数字じゃなくて、**「その世界に入るチケット」**なんだよね。

64GBだと、Qwen 3.6 35B-A3B(33GB)を1個動かして、メモリの半分を使う。もう1個モデルを載せようとしたら、もうギリギリ。OSが息をするのも忘れないといけない。

128GBだと、35Bモデル2個 + 7Bサブモデル + KVキャッシュ が全部乗る。しかも余裕で。

この違いは、使ってみると「あ、これ別のデバイスだ」と思うレベル。同じApple Siliconでも、64GBと128GBは「iPhoneとiPadくらい違う」(個人の感想です)。


第1章 — ローカルLLMの物理を3分で理解する

技術的な話に入る前に、一つだけ約束してほしい。

「tok/s」っていう単位に魔法を見ないでほしい。

LLMの推論速度は、ようするに「メモリ帯域で決まる」。それだけ。

トークン生成速度の支配方程式

decode_time_per_token = model_size_bytes / memory_bandwidth

これだけ。これがすべて。

例えば:

モデルサイズ(Q4)帯域理論上限
7B モデル~4GB400 GB/s (M1 Max)100 tok/s
35B MoE~22GB400 GB/s18 tok/s 上限」
70B Dense~40GB400 GB/s10 tok/s
120B MoE~60GB (MXFP4)400 GB/s6.6 tok/s
DeepSeek V4 Flash 2-bit~55GB614 GB/s (M5 Max)11 tok/s 理論値

実際にはオーバーヘッドがあるから、理論値の70-80%が出れば良い方。

つまり何が言いたいか。

128GB Macを買ったら「何でも動く」は嘘ではないけど、「何でも速い」は嘘。載るけど遅い、という領域が64GBより広いだけ。そこを誤解しないでほしい。

Prefill vs Decode — 二つのフェーズ

LLMの推論には二つのフェーズがある:

  1. Prefill(プロンプト処理): 計算量依存。全トークンを一気に処理する。「読む」フェーズ
  2. Decode(トークン生成): メモリ帯域依存。1トークンごとに全パラメータを読む。「書く」フェーズ

チャットで使う分には、Decode速度(書く速度)が体感に直結する。コード補完や長文RAGだと、Prefill速度(読む速度)も効いてくる。

M5 MaxのNeural Acceleratorsは、MLXの計算グラフをハードウェアレベルで加速する。ようするに、Prefill(計算依存)が速くなる。Qwen3-14B 4bitでTTFT(Time To First Token)がM4比で4.06倍。これはデカい。

一方でDecode(帯域依存)の向上は1.19倍。帯域はM1 Maxの400 GB/s → M5 Maxの614 GB/sだから、1.53倍の帯域増に対して1.19倍の速度向上。うん、まあ、そうだよね。物理は嘘をつかない。


第2章 — 128GB Macで動く「アンセンサードLLM」完全カタログ

さて、本題。

「アンセンサードLLM」っていうと、何かアンダーグラウンドな響きがあるけど、**エンジニアリングの観点で言えば「アルignedされたモデルから、余計なガードレールを除去した状態」**のこと。

Abliteration(アブリテレーション)っていう手法が主流で、ようするに**「モデルの中の『拒否回路』を方向ベクトルで特定して、それをニュートラルにする」**という技術。手術みたいなもんだ。

これを上手くやると、ベースモデルの知能をほぼ落とさずに、ガードレールだけを除去できる。

A. 実測ベンチマーク — 64GB M1 Maxでの結果(128GBなら更快)

これはKT艦隊の4号機(M1 Max 64GB)で実際に測ったデータ。128GBなら、これらを同時に2-3個動かせる。

モデルサイズ生成速度Prefillアンセンサード備考
cron-3b3.2B100.6 tok/s283.9❌速すぎて笑う
sgemma-lightning7.5B79.5 tok/s81.6❓(ヘッドのみ)—
gemma4-uncensored7.5B54.6 tok/s272.4✅Prefill爆速
supergemma4-e4b-abliterated7.5B53.4 tok/s48.9✅Prefill遅め
ornstein3734.7B MoE29.2 tok/s37.7❓—
Qwen3.6-35B uncensored22GB~2-5 tok/s超遅い✅重すぎ注意

ここでの教訓: モデルサイズ ≠ ファイルサイズ。MoEモデルは「全パラメータが動くわけではない」から、ファイルが22GBでも推論時に全パラメータを読むと遅くなる。

B. アンセンサード性能ランキング

🏆 JANG_4M-CRACK v2(Gemma-4-31Bベース)

指標スコアコメント
HarmBench93.7%ほぼ全ての制限なしに応答
MMLU71.5%ベースから-2%のみ(知能低下ほぼなし)
Vision✅マルチモーダル対応
GGUF✅Ollamaで動く

一言で言えば: Gemma-4-31Bをベースに、JANG_4Mという手法でCRACK(完全解除)したモデル。93.7% HarmBenchは驚異的。知能低下もわずか2%。**「賢くて何でも答える」**を実現している。

🥇 Qwen3.6-27B アンセンサード6種比較

天丼界のやんちゃん(yanchan2020氏)の比較レビューからの引用:

用途1位理由
Web Deep SearchWasserstein無限ループ防止 + 長文記憶維持 + 拒否率0/465
コーディングDavidAU NEO-CODE唯一のコーディング特化FT。NEO-CODE量子化でdrift逆転
バランスllmfan46 Heretic v2KL発散0.0021でベース最忠実。MCP対応

注目ポイント: Wasserstein修復という手法で、拒否率0/465を達成。これは「プロンプトを送って、465回全部、一度も拒否しなかった」という意味。エージェントワークフローには必須の特性。

🥈 Huihui系 — Claude 4.6 Opus の魂をQwenに

モデルサイズtok/sスコア
Huihui-Qwen3.5-35B-A3B-Claude-4.6-Opus-abliterated36GB76.893
Huihui-Qwen3.5-35B-A3B-abliterated36GB76.893

ここが面白い: Huihui系はClaude 4.6 Opusの推論品質を蒸留している。つまり「Claudeの頭脳をアンセンサードな体に移植した」ようなモデル。76.8 tok/sで動くから、実用性も高い。

C. 105Bの怪物 — Sarvam-105b-uncensored

これが個人的に一番驚いたデータ。

Sarvam-105b-uncensored:105Bパラメータのアンセンサードモデルが、M1 Max 64GB(メモリ44.5%使用)でPerfect判定、36.1 tok/s。

どうしてこれが動くのか? → MoE(Mixture of Experts)だから。全パラメータが105Bでも、推論時にアクティブなのは一部。メモリに載るサイズが32GB程度で済む。

128GB Macなら、この105Bモデル + もう一つ35Bモデルを同時に動かせる。エージェントシステムで「メイン推論(105B)+ ツール実行(7B)」みたいな構成が、ローカルで完結する。


第3章 — DeepSeek V4 Flash を128GBで動かす

64GBでは何が起きたか

DeepSeek V4 Flash(284B MoE)を2-bit量子化(IQ2_XXS)すると、重みが55-60GBになる。

64GB Macでは、これにKVキャッシュとOSのメモリが加わってOOM(Out of Memory)。動かない。**「載るけど動かない」**という残酷な領域。

128GBなら何ができるか

128GBなら、重み60GB + KVキャッシュ20-30GB + OS で、まだ余裕が残る。

理論的なトークン生成速度(M5 Max 614 GB/s想定):

model_size: 55GB (IQ2_XXS)
bandwidth: 614 GB/s
decode_limit: 55 / 614 = 89.6ms/token ≈ 11.2 tok/s(理論上限)
実効: ~7-9 tok/sと推定

速くはない。でも、「DeepSeek V4の推論品質がローカルで7-9 tok/sで出る」というのは、2026年7月時点で個人が持てる最強のローカルLLM環境の一つ。

DS4 — antirezの「V4 Flash専用Metal推論エンジン」

Salvatore Sanfilippo(antirez氏、Redisの作者)が制作したDS4という推論エンジンがある。DeepSeek V4 Flash専用にMetal(Apple GPU API)を最適化している。

llama.cppのMetalバックエンドは広いモデルに対応しているが、V4 Flashのような巨大MoEモデルでは最適化の余地が残っている。DS4は「V4 Flashだけを速くする」ことに特化することで、llama.cppより高速化を狙っている。

まだコミュニティの実測データが少ない。 ここは要ウォッチ。

CyberNeurova — 次の黒船

CyberNeurova Abliterated版は、DeepSeek V4系向けの81GB版が公開され、Metalでの動作も確認されている。

ただし、これをベンチマークした人がほとんどいない。

JANG_4M-CRACK(93.7% HarmBench)との比較は、おそらく誰もやっていない。ここが記事の独自性になればいいなと思っている。

⚠️ CyberNeurovaの実測ベンチマーク(tok/s, HarmBench, MMLU)は、筆者の環境でもまだ未検証。Redditの断片的な報告では「DS4 q2-q4-imatrixはM5 Max 128GBで25-35 tok/s程度、技術作業では非常に評価が高い」という声があるが、まだ確証がない。


第4章 — 推論エンジン選びのジレンマ

128GB Macを持ってる君に、もう一つ重要な話。**「どのエンジンで動かすか」**で速度が2-3倍変わる。

エンジン比較(2026年7月最新)

エンジン得意領域速度傾向備考
MLX / mlx-lm長文生成GGUF比15-30%高速・10%省メモリApple公式。QLoRA対応
llama.cpp短対話(prefill)安定・広いモデル対応Metal バックエンド
Ollama v0.30手軽さraw llama.cpp比~50%低下 ⚠️Go wrapper層のオーバーヘッド
DS4V4 Flash専用要検証antirez制作
SwiftLM超省メモリSSDストリーミングで革新的純Swift+Metal
Rapid-MLX高速Ollama代替M3 Ultraで2-4.2x高速新興

Ollamaの「50%低下」問題

Ollamaは便利だ。ollama run一発でモデルが動く。Claude Code / Hermes Agent / OpenCodeの統合も済んでいる。

でも、Ollamaは内部でllama.cppをGo wrapper経由で呼んでいる。このwrapper層で、raw llama.cpp比で約50%の性能低下が起きる。

つまり、生のllama.cppで30 tok/s出るモデルが、Ollama経由だと15 tok/sになる。

解決策:

  • 手軽さ優先 → Ollama(それでも実用範囲)
  • 速度優先 → mlx-lm または raw llama.cpp
  • V4 Flash専用 → DS4

SwiftLMの可能性 — 「Pythonが要らない」革命

SwiftLMは純Swift + Metalで書かれた推論サーバー。Pythonが不要。シングルバイナリ。

最大の特徴はSSDエキスパートストリーミング:

122BのMoEモデルを64GB Macで動かして、常駐メモリ約10GB。

どういうことか。MoEモデルは「アクティブでないエキスパート(サブネットワーク)をSSDに退避させ、必要な時にだけロードする」という仕組み。メモリに全パラメータを載せない。

128GB Macなら、V4 Flashの全エキスパートをメモリに載せつつ、SSDストリーミングでKVキャッシュを拡張できるかもしれない。

TurboQuantという機能も面白い。KVキャッシュを約1/3に圧縮して、24GB MacBookで26Bモデル + 40Kコンテキストが動く。128GBなら、どれだけ長文を食わせられるか。想像が膨らむ。


第5章 — 128GB Macでの「同時稼働」戦略

ここが128GBの最大の利点。64GB勢には真似できない領域。

推載成ゴ

128GB統合メモリの配分イメージ:

┌─────────────────────────────────────┐
│  メイン推論モデル (35B MoE MLX 4bit)  │  〜33GB
│  例: Huihui-Qwen3.5-35B-abliterated  │
├─────────────────────────────────────┤
│  サブモデル (7-8B GGUF)               │  〜5GB
│  例: gemma4-uncensored (tool use用)   │
├─────────────────────────────────────┤
│  VLM / ビジョンモデル (8B)            │  〜6GB
│  例: Qwen3-VL-8B (画像理解用)         │
├─────────────────────────────────────┤
│  KVキャッシュ + バッファ              │  〜30GB
├─────────────────────────────────────┤
│  OS + その他                          │  〜15GB
├─────────────────────────────────────┤
│  余裕                                 │  〜39GB ←★ここが64GBにはない
└─────────────────────────────────────┘

この「余裕39GB」が何を意味するか。

DeepSeek V4 Flash 2-bit(55GB)を載せても、まだ8GBモデルを1個追加できる。

あるいは、Sarvam-105b(32GB実効)+ Huihui-35B(33GB)+ gemma4-uncensored 7.5B(5GB) の三段構えも可能。

エージェントワークフローでの活用

Hermes Agent(やClaude Code、OpenCode等のエージェントフレームワーク)を使う場合、複数のモデルを役割分担させられる:

  • プランニング: Huihui-35B(Claude蒸留の推論力)
  • ツール実行: gemma4-uncensored 7.5B(54.6 tok/sの速さ)
  • 画像理解: Qwen3-VL-8B(マルチモーダル)
  • ** DeepSeek V4 Flash 2-bit(重いけど深い推論)

これが全部ローカルで、オフラインで、完全プライベートで動く。

月額$20のAPIサブスクと違って、電気代(月150〜300円程度)しかかからない。3年使えば明らかにMacの方が安い。


第6章 — CyberNeurova vs JANG-CRACK:誰もやっていない比較

現状わかっていること

項目JANG_4M-CRACK v2CyberNeurova Abliterated
ベースモデルGemma-4-31BDeepSeek V4 Flash系
HarmBench93.7%未検証
MMLU71.5%(-2%)未検証
ファイルサイズGGUF版あり81GB版あり
Metal動作✅ 確認済✅ 確認済
コミュニティ評価Wiki記録ありReddit断片的

筆者の仮説

CyberNeurovaの方が「賢い」可能性が高い。

理由はシンプル。ベースモデルが違う。

  • Gemma-4-31B → Googleの31B Dense(Vision対応)
  • DeepSeek V4 Flash 284B → MoE、アクティブパラメータは大きい

ベースの知能が違えば、アンセンサード化した後の知能も違う。DeepSeek V4系の方が、推論・コーディング・長文理解で優れている可能性が高い。

ただし:

  • JANG_4M-CRACKの方が「軽い」。31B Denseは確実に動く。CyberNeurovaは81GB版が必要で、128GBでもギリギリ。
  • JANG_4Mの方が「実績がある」。HarmBench 93.7%は実測値。CyberNeurovaの数値はまだ信頼できるソースがない。

結論:どちらも試すべき

128GB Macを持っているなら、両方動かせる。それが128GBの強み。

  1. 日常のエージェントワークフロー → JANG_4M-CRACK(軽い・速い・実績あり)
  2. 深い推論が必要な時 → CyberNeurova(重いけど、知的密度が高いはず)

この切り替えをプロンプトやタスクの複雑さで自動化するのが、次のステップになる。


第7章 — ハードウェア選択の最終回答

128GB Macの選択肢(2026年7月時点)

マシンチップ帯域価格帯推奨度
Mac Studio M3 Max 128GBM3 Max400 GB/s$3,500-4,500★★★★ 今買うなら
MacBook Pro M5 Max 128GBM5 Max614 GB/s$4,000-5,000★★★★★ 最新なら
Mac Studio M3 Ultra 192GBM3 Ultra819 GB/s$5,500-7,000★★★★ 予算あれば
Mac Studio M5 Ultra (予定)M5 Ultra1,100 GB/s$7,000+ (Q4)★★★★★ 待てるなら

メモリ帯域の意味

M1 Max → M5 Maxで、帯域は400 → 614 GB/s(1.53倍)。

これはトークン生成速度にほぼ比例する。35Bモデルなら、M1 Maxで31 tok/s → M5 Maxで47-48 tok/sと推定される。

105Bモデルなら、M1 Maxで36 tok/s → M5 Maxで55 tok/s付近。

DeepSeek V4 Flash 2-bitなら、M5 Maxで7-11 tok/s(理論値)。

「M5 Ultra 512GB」を待つべきか

M5 Ultra Mac Studio(2026年Q4予定)は、1,100 GB/sの帯域と512GBの統合メモリが噂されている。

これが実現すれば:

  • DeepSeek V4 Flash 4-bit(110GB)が余裕で動く
  • GLM-5.2(744B MoE)のQ4(220GB)も動く
  • 複数の巨大モデルを同時に

KT艦隊の技術巻(2026年6月)の結論を引用すると:

「1台で全部」は M5 Ultra 512GB (1,100 GB/s + 512GB) だけが解決する = 2026年Q4 待ちが正解

でも、128GB Macを今持っている君には、待つ必要はない。今すでに、世界の99%の人が持っていない環境がある。


おわりに — 128GBは「道具」から「相棒」への境界線

スタバのコーヒーって、トールでもグラベンでも、中身は同じコーヒーだよね。違いは「量」だけ。

でも、LLMの世界は違う。64GBと128GBは、「量」の違いじゃなくて「質」の違いを作る。

64GBでは「動かない」ものが、128GBでは「動く」。その境界を越えた瞬間、Macは単なる道具から相棒に変わる。

  • DeepSeek V4 Flashがローカルで動く
  • 105Bのアンセンサードモデルが36 tok/sで回る
  • 複数モデルを同時に立ち上げて、エージェントシステムが組める
  • すべてがオフラインで、プライベートで、電気代月300円で

それが128GBの世界。

NVIDIAのRTX Spark(273 GB/s)より帯域で2倍勝ってる。DGX Spark($4,700)と違って、ファンも静かで、macOSも使える。ComfyUIも動く。Hermes Agentも動く。

一番高いコーヒーを飲んでる君に、一番面白い遊び場がある。


Appendix — データソースと検証状況

実測データ(検証済み)

データソース検証日
M1 Max 64GB ベンチマーク一覧KT艦隊4号機spook実測2026-04-22
JANG_4M-CRACK v2 HarmBenchHuggingFace / leftcurvedev_2026-04-11
Qwen3.6-27B 6種比較yanchan2020氏レビュー2026-05-03
Huihui/Sarvam Perfect判定KT艦隊4号機実測2026-04-15
メモリ帯域別decode比較公開ベンチマーク統合2026-06-02
M5 Neural Accelerators効果公開ベンチマーク2026-07-04

未検証データ(要追加調査)

データ状況優先度
CyberNeurova HarmBench/tok/s未収集🔴 High
DS4 (antirez) 実測速度コミュニティ断片的🔴 High
DeepSeek V4 Flash 2-bit M5 Max実測Reddit報告のみ(25-35 tok/s?)🟡 Medium
日本語タスク性能評価全モデル未検証🟡 Medium

参考リポジトリ・プロジェクト

  • mlx-lm: Apple公式MLX推論フレームワーク
  • llama.cpp b9741+: Metal安定・V4 Flash実験的サポート
  • DS4: antirez制作・V4 Flash専用Metal推論
  • SwiftLM: 純Swift・SSDエキスパートストリーミング
  • Rapid-MLX: Ollama代替・2-4.2x高速
  • Ollama v0.30: MLX+GGUF自動ルーティング

この記事のデータは、KT艦隊の3層記憶システム(Fabric → LLMWiki → G-Brain)から回収されたセッションログ・実測ベンチマーク・技術調査結果を基に構成されています。実測値はM1 Max 64GB環境のものが多く、M5 Max 128GBでの検証は継続中です。

2026年7月 執筆