128GB革命 #8 通説の訂正——「Macは帯域律速」は半分だけ正しい
温泉旅館の大浴場で湯船の前に立ったとき、たいてい「掛け湯は42度」とか「源泉かけ流し」とか、小さな札が湯口のそばに貼ってあるんだよね。あの札を鵜呑みにして「この旅館の湯は全部42度だ」って決めつけると、露天地の露天風呂はぬるくて、内湯は熱い、という現実に当たって驚く。お湯の温度って、「旅館」という枠じゃなくて「湯船ごと」に決まってるんだよね。ローカルLLMの速度にも、まったく同じ種類の勘違いがある。「Macはメモリ帯域が遅いからLLMも遅い」という言説、あれは札に書かれた42度であって、湯船ごとの実際の温度じゃないんだよね。
前回はMoEとDenseで律速が変わる話をしたけど、今日はその前段にある「そもそも帯域律速とは何か」から、通説が半分だけ正しい理由まで、もう一段掘り下げる。題して通説の訂正。題材は日本語圏いちばんの実測書き手、Zennのkamo78さんのmactopテレメトリ実測だ。
通説の正体——「読み出す分量」の計算
まず、なぜ「Macは帯域律速」と言われるのか、正しい部分から確かめよう。LLMが1トークン生成するとき、モデルの重みをメモリから読み出す必要がある。1トークンあたりの実効読み出し量がおおよそ決まっていて、理論速度は「帯域 ÷ 実効読み出し量」で見積もれる。メモリから重みが届く速度が律速なら、decode速度は帯域でほぼ決まる。帯域が倍なら速度も倍。ここまでは正しい物理だ。そしてこの物理が一番きれいに当てはまるのが、まさにMacなんだよね。Apple SiliconはメモリとGPUが同じ土台を共有していて、帯域の数字がそのまま仕様表に書いてある。614 GB/sという数字もメーカー公表値だから、「帯域で速度が決まる」世界では、Macほど計算が当たりやすいマシンはない。だからこそ、みんなMacを帯域律速の見本として語ってきたんだよね。

たとえばGemma4 31B(Q4・19GB)は19GBを毎トークン読み出す。M5 Maxの帯域は約614 GB/sだから、614÷19で理論上限は1秒に32回前後。実際の測定は23 tok/sで、オーバーヘッドを引けば計算どおり。Hermes3 70B(Q4_K_M・42GB)なら理論14.6回/秒に対し実測11 tok/s。つまりDenseモデル、毎回全部の重みを読む構造のモデルでは、Macのdecode速度は帯域の物理限界まで張り付いている。通説が「正しい」と言えるのは、このDenseの世界に限った話なんだよね。
テレメトリが見た「余っている帯域」
ここでkamo78さんのmactopテレメトリの話だ。前回埋めた可視化動画でMoEの「振り分け」の直感はついたはずだけど、今日はその振り分けが実際のマシンでどう記録されるかの話。mactopというのはMacのGPUクロックやメモリ帯域の使用率をリアルタイムで監視するツールで、これを推論中に表示させながら実測したのが、彼のZenn記事(M5 MaxでDeepSeek V4 Flash & 多モデルベンチマーク)なんだよね。ベンチのtok/sを並べるだけの記事は世にたくさんあるけど、「推論中、帯域が何パーセント使われているか」を数字で見せた記事は、私の調査では彼のものだけなんだよね。

数字がこれだ。DeepSeek V4 Flash、総容量284B・活性化13BのMoEをIQ2XXS・81GBで載せて、34.1 tok/s。このとき帯域使用率は16%。gpt-oss 120B(mxfp4・65GB)なら72 tok/sで使用率22%。Qwen3.6-35B-A3B(Q4_K_M・23GB)は58 tok/sで15%。MoEモデルはどれも帯域の2割も使っていない。パイプの太さが614 GB/sあって、その16%しか水が流れていない。じゃあ何が律速かと言えば、GPUの演算側。エキスパートの振り分けと活性化計算のほうが先に忙しくなるんだよね。
たとえるなら、反対車線の高速道路だ。Denseは片側3車線を車でぎっしり埋めて、制限速度どおりに流れている状態。MoEは同じ6車線を1割しか使わずに走っていて、それでいて速い。じゃあ制限速度を上げても(帯域を増やしても)MoEはほとんど速くならない。詰まっているのは道路じゃなくて、料金所を通る車の処理能力、つまり演算のほうなんだよね。
つまり「Macは帯域律速」という札は、Denseの湯船には正確に貼られているけど、MoEの湯船には「演算律速」の札がかかっている。同じ旅館なのに、湯船ごとに温度が全然違う。そして事実を数字で教えてくれる人が、今のところ一人しかいないんだよね。
RTX 5090と同じ土俵で並べると
この通説の訂正が一番はっきりするのが、RTX 5090との同条件比較だ。kamo78さんはRTX 5090(WSL2環境)でも同じモデルを同じ条件で測っている。qwen3.6 35B(MoE・Q4)ではM5 Maxが58.2 tok/s、5090が118 tok/sで2.0倍。gemma4 31B(Dense)では21.6 tok/s対約61 tok/sで2.8倍。decodeは2.0〜2.8倍、prefillは2〜13倍の5090優位。ここまではGPUの圧勝なんだよね。

この数字、実は「MoEは演算律速」仮説の裏付けにもなっている。M5 Maxと5090のメモリ帯域差は倍以下なのに、MoEのdecode差は2.0倍ある。帯域だけが律速なら、帯域差にほぼ比例するはずだから、この開きは演算側の差がそのまま速度に出ていると読むのが自然だ。一方Denseは帯域に張り付く構造だから、温度やクロックの条件が揃えば差は帯域比に近づく。律速がどこにあるかで、機種間比較の「開き方」まで変わるんだよね。
でもね、この比較には致命的な但し書きがひとつある。RTX 5090のVRAMは32GB。DeepSeek V4 FlashはIQ2XXSの激圧縮ですら81GBあって、32GBには載らない。NVIDIAの最強GPUで「載る最新フロンティア」を動かそうとすると、容量の壁に阻まれて物理的に不可能。128GBユニファイドメモリのM5 Maxだけが、284B級のMoEを一台で丸ごと抱えられる。だからこの比較は性能比じゃなくて容量の壁の話で、Mac派が「載せられること」に価値を置く理由もここにあるんだよね。
そしてもうひとつ。3分連続decodeの熱テストで、RTX 5090はクロックが1MHzも下がらなかった。熱の話は次回に譲るけど、10分かけて温めた寿司が冷める速度は、皿と加熱器の組み合わせ次第というだけの話で、「寿司は冷めるもの」という通説が環境で書き換わるのと同じだ。「Macは遅い」の内実が環境や構造でこんなに変わるものだという予告として覚えて帰ってほしい。
通説を「使い分ける」ための実践
さて、訂正した通説をどう使いこなすか。実践は3つだ。

まず、モデル選びのとき「Macは帯域が弱いからDenseは不利」という通説を、逆手に取ることができる。Denseを載せるなら帯域が天井になるから、モデルサイズを抑えるのが正しい判断だし、MoEを載せるなら帯域は余っているから、量子化をそれほど恐れなくていい。実際DeepSeek V4 FlashはIQ2XXSという激しい2bit級圧縮でも34.1 tok/sで実用速度が出ている。帯域が余っているマシンでは、圧縮の代償が速度に出にくいんだよね。選ぶ順番としては「まず構造、次に量子化、最後にサイズ」。通説を信じてサイズだけで縮めていくと、Denseの小さいモデルとMoEの大きいモデルを同じ物差しで測って、変なところで妥協することになる。前回見たとおり、117BのMoEが72 tok/sで31BのDenseが23 tok/s。物差しを間違えると、速いものを捨てて遅いものを残すんだよね。
次に、ベンチ投稿の読み方。tok/sだけ並んだ投稿に「Macは遅い」「Macは速い」と結論が書いてあっても、それは42度の札を読んだだけかもしれない。本当に参照するべきは「MoEかDenseか」「帯域使用率は何%か」の2点。テレメトリ付きの実測、つまりkamo78さんのような投稿を優先的に拾う。Redditのベンチスレでも、mactopのような監視ツールの画面を添付している投稿は、数字の信頼性が段違いだ。反対に「手元では◯◯ tok/s出ました」だけで条件が書かれていない投稿は、振り返りテストくらいに思っておくのが安全なんだよね。
最後に、人をフォローする基準。私の調査では「MoEはGPU演算律速、Denseは帯域律速」をテレメトリで定量証明している記事は、世界を見渡してもkamo78さんのものが唯一だった。推定値に過ぎない私の調査範囲の話だけど、それでも「数字の隣に条件が書いてある人」を優先的にフォローするのは、どんなコミュニティでも正しい戦略だと思う。名前で検索してZenn記事をブックマークしておく価値は十分にある。旅館の湯船ごとの温度を、ちゃんと計って記録してくれる人がいる。ローカルLLMの世界が面白いのは、営利の調査機関じゃなくて、そういう個人の検証者が一枚岩の通説を静かに訂正していくところなんだよね。
今日の要点をひとつだけ言うと、「Macは帯域律速」はDenseでは正しい物理で、MoEでは誤り。湯船ごとに温度が違う旅館の札を、鵜呑みにしないこと。数字は、測った人の隣に書かれた条件ごと読むんだよね。
次回は「熱という名の敵」——3分でクロックが半減する薄型筐体の実態と、RTX 5090が1MHzも下がらない理由を、throttle実測から読み解く。