128GB革命 #17 連載を終えて——まとめの代わりに「次の問い」
128GB革命 #17 連載を終えて——まとめの代わりに「次の問い」
引っ越しの段ボールを閉めきる前に、部屋の中をもう一周する時間って大事だよね。「全部積んだつもり」でも、後ろの棚から一本だけ抜け落ちてる、あの時間。この連載も今日で17回、最後の回だ。閉める前に、17回分の棚をもう一周して、数字がどうつながっていたかを確かめたい。まとめはしない。代わりに、この連載が最後に残す問いを、数字ごと渡そうと思う。
今回のデータは2026年8月16日時点の調査レポート(データ少佐によるM5 Max 128GBコミュニティ調査)の全頁と、第1回から第16回までの連載が扱ってきた数字を突き合わせている。前回(第16回)はLLMCheckのリーダーボードを「順位に速度を添えて読む」という改善メモ付きで読んだ。今回はさらに一歩進めて、順位でも速度でもなく「何が残ったか」で振り返るんだよね。
17回分の数字を並べ直すと見える構造
最初に、この連載の背骨になった数字を順に置いておくね。第2回ではoMLX作者jundot氏(u/cryingneko)の2016票スレ(2026-03-11・r/LocalLLaMA)がコミュニティの心臓部だと書いた。彼はスレにmlx_lm.generateの実行ログをそのまま貼る「数字だけ」スタイルの人で、同時にApple Silicon向け推論サーバーoMLXの作者でもある。第3回はantirez氏(Redis生みの親)が2週間で書いたds4エンジンで、DeepSeek V4 Flash(284B MoE)が短いプロンプトで39.35 tok/s、64kコンテキストで27.6 tok/s。M3 Maxでのフル速度時の消費電力は50W、prefillは460 tok/sという数字も残してる。第4回は@jun_song氏の「$2k/$4k/$7k」階層ガイドで、約2千ドルでRTX 3090+Qwen3.8-27B、約4千ドルでDGX Spark+DeepSeek V4 Flash 2.5bit、約7千ドルでM5 Max 128GB、という事実上の基準が示された。第6回と第16回で触れたu/ConformalFuelTank氏の実測が、Qwen3.5-122B-A10B(4bit・71.9GB)で65.8 tok/s、16kコンテキストで60.6 tok/s、32kで54.9 tok/s(メモリ76.4GB)。第16回のLLMCheckでは、128GBで収まるモデルは81中59種だった。
この数字たちを横並びにすると、一つの傾向が読める。128GBという容量が「フロンティア級のモデルがラップトップに載る」ことを実証していて、推論という仕事に限れば電力も静音も取れる、という世界だよね。数字で言えば、34.1〜39.35 tok/sで284Bが動き、65.8 tok/sで122Bが動く。34.1 tok/sという数字は、kamo78氏がIQ2XXS量子化・約81GBのDeepSeek V4 Flashを出したときの値で、第7回以来この連載の基礎データになってた。第1回に「完全地図」として描いた風景は、最終回の時点で地図として機能してたと思う。
連載を貫いた一本の訂正
17回の中で一番価値があったのは何かと聞かれたら、僕は第7回と第8回の訂正を挙げるんだよね。「Apple Siliconはメモリ帯域がボトルネック」という通説を、kamo78氏のZenn記事(mactopテレメトリ実測)が「MoEは帯域を15〜22%しか使わずGPU演算が律速、Denseは帯域に張り付く」という形で訂正した。同じ128GBでも、モデルの構造(MoEかDenseか)で律速の原因が180度変わる。
これが大事なのは、ハードの金額の話($2k/$4k/$7kの階層)も、DGX Sparkとの論争も、結局この一本の事実の上に載ってるからだよね。DGX Sparkとの比較(第12回・第13回)では、帯域614対273GB/sでMac派がbatch=1のdecodeを取り、DGX派がlmsys実測のbatch32で368 tpsという並列スループットを取る、という条件付き判定に収束した。どちらが「速いか」ではなく、「何を載せて・何人で使うか」で判定が反転する。この読み替えができたのは、帯域という物理量をkamo78氏がテレメトリで数値化してくれたからなんだよね。
熱と筐体——購入判断を変えた数字
もう一つ、個人的に影響が大きかったのは第9回・第10回の熱の話だよね。同じM5 Maxでも、薄型のMacBook ProとMac Studioでは実力が3割近く違う。kamo78氏の実測では、3分の連続decodeで薄型筐体は44→98°Cまで上がり、Denseモデル(Gemma4 31B)ではクロックが1299→690MHzまで下がってdecodeが-29.8%劣化する。MoE(Qwen3.6 35B)なら劣化は-13.1%で済む。一方RTX 5090(WSL2)は3分連続でもクロックが1MHzも下がらなかった。
この数字が教えてくれるのは、ピーク速度で購入判断をするのは危険ということだよね。スペックシートのtok/sは「冷えた状態の最初の30秒」の数字で、実運用は「throttle後の速度」だからだよね。kamo78氏自身が「Mac Studioにしておけば良かったかも」と結論に書いてたのが、日本語圏の発信の誠実さを表してると思う。
日本語圏と「消えた3人」——記録としての透明性
第14回では日本語圏の強さを「運用ノウハウ」に見た。英語圏が単一の巨大ハブ(r/LocalLLaMA)に集まるのに対して、日本語圏はZenn・Qiita・note・Xに分散してる。弱みは相互接続の弱さで、強みは「買った後」の情報の濃さ。冷却台のレビュー、エラー対処、機密データをクラウドに出さない運用。あきらパパ(@akira_papa_IT)の自作モデル「akira-papa 1.0」(MLX/GGUF両対応)も、この文脈で捉えると「配布スタイルそのものが文化」だというのが読めるんだよね。
そして第15回は「消えた3人」の話だった。@C_of_Creativity / @ktam72 / @hasegawa の3アカウントは、Web・X・Reddit・note・Zenn・Qiita・GitHubの全走査で痕跡ゼロだった。連載では実名も推測も出さず、「裏付けなし」として同じ筆致で記録した。調査というのは「見つかったもの」を書く仕事じゃなくて、「見つからなかったもの」も同じ筆致で書く仕事だよね。この連載が技術記事としてより前に、記録として意味を持つのはこの部分だと思ってる。
次の問い——読者に渡したい3つ
最後に、この連載が残す問いを3つ置いておくね。
問い1は「あなたの用途は何人分?」。DGX Spark論争の決着は、単発decodeならMac、並列スループット・訓練ならDGXという条件付き判定だった。1人1エージェントならM5 Max 128GB(帯域614GB/s・電力効率・静音)、並列エージェント群ならbatch32で368 tpsのDGX Spark。自分の仕事がどちら側かを、まず数字で書き出してみてほしい。
問い2は「ピークと実力、どちらを見ているか」。第9回の熱の数字(Denseで-29.8%・5090はクロック不変)は、Macに限らず薄型筐体全般に当てはまる話だよね。スペックシートのtok/sではなく、3分後・10分後のtok/sを見る習慣を持ってほしい。
問い3は「分断された知識をどう束ねるか」。日本語圏は運用ノウハウが濃いけどハブがない。oMLXのコミュニティベンチ(38万行以上・M5 Max 40cでフィルタ可能)のような共有基盤に、日本語の実測を上げていく人が増えるかどうか。kamo78氏のテレメトリが世界の常識を1つ訂正したように、定量の一手が次の訂正を生む。次に訂正する側に回るのは、この記事を読んでる誰かかもしれないんだよね。
この3つの問いを、実際の手の形に落とすなら、こんな感じになると思ってる。まず用途を1枚の紙に書き出して、batch=1で動くのか並列で動くのかを決める。次に候補モデルをLLMCheckで絞って、いきなり本番データを載せないで、3分間の連続decodeを回してから「10分後のtok/s」を測る。スペックシートの数字は宣伝文句で、throttle後の数字だけが自分の仕事の速度だからだよね。熱の話(第9回)で書いた通りDenseモデルなら-29.8%落ちる世界なので、ピークと実力の差は一度自分の手で確認しておく価値がある。最後に、その実測をどこかに書き残す。ZennでもnoteでもRedditでもいい。oMLXのベンチに38万行たまってる数字の裏には、全部どこかの誰かが「測った」痕跡があって、それが積み上がったのがあの地図なんだよね。kamo78氏のテレメトリ1本が通説を訂正できたのは、その1本が「測って・書いた」の形をしてたからだと思う。
最後にもう一つ、連載の外にある問いを。128GBがラップトップに載せた時代の次は、Thunderbolt 5で複数台を連結する分散推論(2台のMac StudioをTB5でつなぐと最大3.2倍、という報告がある)が、個人にも「本番」を持ち込めるかどうか。jundot氏がすでにM3 Ultra 512GBでの比較実測を投稿してるように、フロンティアはもう動き出してる。この連載はここで閉じるけど、数字だけは嘘をつかない。次に数字を投下するのは君だ、という話で締めさせてもらうね。
次回予告
第17回をもって「128GB革命」連載は完結です。16回分の全データと全出典は、この連載の各回に収めてあります。ご愛読ありがとうございました。
出典
- DeepSeek V4 Flash 39.35 tok/s(短prompt)・27.6 tok/s(64k ctx)・prefill 460 tok/s・消費電力50W——antirez「ds4」README(2026年・GitHub / github.com/antirez/ds4・一次資料=作者本人の実測記録)
- Qwen3.5-122B-A10B 65.8 tok/s(4bit・71.9GB・4k ctx)・60.6 tok/s(16k)・54.9 tok/s(32k・メモリ76.4GB)——u/ConformalFuelTank(Reddit r/LocalLLaMA・2026-03-22前後のスレッド / reddit.com/r/LocalLLaMA/comments/1rqnpvj・一次資料=投稿者本人の実測ログ)
- MoE帯域使用率15〜22%・Denseは帯域に張り付く(Gemma4 31B 94%)・熱throttle検証(44→98°C・クロック1299→690MHz・Dense -29.8%/MoE -13.1%・RTX 5090クロック不変)・DeepSeek V4 Flash 34.1 tok/s(IQ2XXS・約81GB)——kamo78「M5 MaxでDeepSeek V4 Flash & 多モデル ベンチマーク」(Zenn / zenn.dev/kamo78/articles/ds4-m5max-benchmark・2026年・一次資料=mactopテレメトリ実測)
- DGX Spark比較(帯域614 vs 273GB/s・lmsys SGLang実測 batch1 20.5 tps → batch32 368 tps)——lmsys blog「NVIDIA DGX Spark review」(lmsys.org/blog/2025-10-13-nvidia-dgx-spark・2025-10-13・一次資料=lmsys自身の実測)
- LLMCheck 128GB適合(81モデル中59種)——llmcheck.net(2026年8月・調査時点・二次資料=リーダーボード集約)
- oMLXコミュニティベンチ38万行以上・M5 Max 40cフィルタ・jundot氏のM3 Ultra 512GB比較実測——omlx.ai/benchmarks(2026年8月時点・一次資料=コミュニティ投稿実測の集約)
- 2016票スレ=u/cryingneko(jundot氏)「M5 Max just arrived - benchmarks incoming」(2026-03-11・r/LocalLLaMA・一次資料=本人投稿)
- 「$2k/$4k/$7k」ハードウェア階層ガイド——@jun_song(X・2026年・一次資料=本人スレッド)
- 自作モデルakira-papa 1.0(MLX/GGUF両対応)——あきらパパ @akira_papa_IT(X / x.com/akira_papa_IT・2026年・一次資料=本人配布)
- 痕跡ゼロ3名(@C_of_Creativity / @ktam72 / @hasegawa)の全走査結果・調査限界の開示——research-2026-08-16.md §2.3・§7(データ少佐調査・2026-08-16・本連載の一次調査ファイル)
- 分散推論exo(2台のMac StudioをThunderbolt 5で連結・RDMA over TB5で最大3.2倍)——itmedia / gigazine / tumf.dev(2026年・二次資料=報道・解説記事。research-2026-08-16.md §5.3より)
- 128GB革命シリーズ第1〜16回——note.com/keity717(2026年8月〜9月・本連載アーカイブ)