← Back to Home
テクノロジー ·

128GB革命 #7 数字は嘘をつかない——同じ128GBでもMoEとDenseで世界が変わる

128GB革命 #7 数字は嘘をつかない——同じ128GBでもMoEとDenseで世界が変わる

自販機の前で小銭を数えてるときに気づいたんだけど、缶コーヒーの値段って「この自販機では全部160円」って決まってるんだよね。ホットもアイスもミルクもブラックも、ボタンを押す回数は同じ1回で、出てくるまでの時間もほぼ同じ。でも考えてみてほしい。目の前に100台の自販機があって「どれか1台だけ精密に部品が動く」のと「100台全部が軽く動く」の、どちらが速くコーヒーを出せるだろうか。実はローカルLLMの速度も、まったく同じ構造の問題なんだよね。

今日は前回紹介したベンチ職人たちの数字を、一本の表に並べて「嘘をつかない読み方」をやる。題して実測DB完全解説。準備する道具は電卓ひとつと、614 GB/sという帯域の数字だけだ。あ、それと前回の最後で触れた「MoEの仕組みが見たい人向けの可視化動画」は今日の本文にも埋めておくから、物理の直感が欲しくなったら再生してみてほしい。

全部同じマシンで測った表がある

舞台はM5 Max 128GB、40コアGPU。日本語圏いちばんの実測書き手、Zennのkamo78さんが条件をきっちり固定して測った表があるんだよね。Ollamaでtemperature=0・seed=1・max_tokens=256。GPU温度が45度を超えないよう冷却してから計測する。つまり「朝イチの冷えた体で、同じ朝食を食べて、同じ距離を走ったタイム」だけを集めた表なんだよね。

セクション画像

そこに並ぶ数字がこれだ。gpt-oss 120Bがmxfp4・65GBで72 tok/s。Qwen3.6-35B-A3BがQ4_K_M・23GBで58 tok/s、同じモデルのQ8_0・38GBでも51 tok/s。DeepSeek V4 FlashがIQ2XXS・81GBで34.1 tok/s。一方Dense陣営は、Gemma4 31BがQ4・19GBで23 tok/s、Hermes3 70BがQ4_K_M・42GBで11 tok/s。全部同じマシン・同じ条件なのに、最快と最慢で6.5倍の差がついている。ここで注目すべきは「モデルの大きさ」じゃない。117BのMoEが72で、31BのDenseが23。小さいほうが圧倒的に遅い。この逆転が今日の主題なんだよね。

帯域使用率という「喉の詰まり具合」

ポイントは帯域使用率の列に書いてある。M5 Maxのメモリ帯域は約614 GB/s。LLMが1トークン生成するとき、だいたい「モデルの重みを実効的にどれだけ読み出すか」が決まっていて、decode速度は「帯域 ÷ 実効読み出しサイズ」で見積もれる。ここでMoE(Mixture of Experts)について、仕組みを図で見たい人のために専門チャンネルの可視化動画を埋めておくね。エキスパートにトークンがルーティングされる様子がアニメーションで追えるから、「なぜ全パラメータを読まなくていいのか」が3分で直感できるはずだ。

セクション画像

MoEは、全パラメータのうち1トークンあたり数Bしか活性化しない。だから実際に読み出すのは総容量の一部だけで、帯域が余る。数値で見ると、Qwen3.6-35B-A3Bは帯域の15%しか使っていない。gpt-oss 120Bでも22%。DeepSeek V4 Flash(284Bで13B活性化)でも16%。どれも2割足らず。つまりMoEは「GPUの演算力」がボトルネックで、帯域は余りまくっているんだよね。

これに対してDense(全パラメータ毎回読み出し)はどうか。Gemma4 31Bは帯域使用率94%。もう喉の奥まで詰まってる。計算してみよう。19GBを毎トークン読み出すなら、614 GB/s ÷ 19GB ≈ 32回/秒、つまり理論上限は32 tok/s前後。実際は23 tok/sだから、オーバーヘッドを差し引いて8割弱。ほぼ帯域の物理限界まで出しているんだよね。Hermes3 70Bだと42GB ÷ 614 GB/s ≈ 14.6回/秒が理論値、実測11 tok/s。これも計算とほぼ一致する。つまりDenseは帯域律速ど真ん中で、Macの帯域が天井にぶつかっている。一方MoEは演算律速で、帯域の8割が遊んでいる。

ここから導かれる結論はシンプルだ。「Apple Siliconはメモリ帯域のボトルネック」という通説は、Denseモデルでは正しくて、MoEモデルでは誤り。同じ128GBマシンでも、載せるモデルの種類によって律速要因が180度変わる。線路の太さ(帯域)は同じでも、走らせる列車の重さと編成で、律速区間が全然違う場所に現れるんだよね。

6.5倍の差を、自販機の比喩で確かめる

冒頭の自販機に戻ろう。MoEは「100台のうち今日担当する数台だけが動けばいい」方式で、必要な台数しか部品を動かさない。だから帯域(部品搬送コンベア)に余裕ができる。演算ユニットの処理能力が先に尽きる。逆にDenseは「全部の部品を毎回コンベアで運ぶ」方式で、コンベアの最大積載量(614 GB/s)に張り付く。だから数字が理論値どおりになる。

セクション画像

この視点を持っていると、ベンチ表の読み方が変わる。まず「65GBのモデルが23GBのモデルより速い」という一見不思議な記録も、構造で説明がつく。gpt-oss 120B(65GB)は1トークンあたりの活性化が少ないから速く、Gemma4 31B(19GB)は全部読むから遅い。サイズはディスク上の話で、速度は毎回読み出す分の話。この二つを混ぜるとなんでもない数字が謎に見えるし、分ければ謎は消える。

そして実際に使い分けを考えると、この差は体感に直結する。72 tok/sのMoEなら返事が途切れない。11 tok/sのDenseだと一文ごとに呼吸が入る。1時間あたりに換算すると約25万9千トークンと約4万トークンの差で、仕事にできる分量がまるで違う。実用で「ローカルLLMを使い続けるか」を決めるのは、ピークなベンチよりこの体感差なんだよね。私の身近な例で言えば、音声入力からの議事メモ起こしなら11 tok/sでも我慢できるけど、コーディングエージェントのように1日に数百回やり取りする用途だと11 tok/sは精神を削る。往復ごとに数秒の待ちが積み重なって、集中が切れる。速いMoEが「道具」になり、遅いDenseが「趣味」になる分水嶺は、だいたい体感で30 tok/sあたりにあると感じてる。推定だけどね。

帯域使用率から「買い物の判断」も読める

さらに深掘りしよう。帯域使用率が分かると、アップグレードの効果予測もできる。たとえばM5 Maxの帯域が614 GB/sで、MoEが15%しか使っていないなら、帯域を1.5倍にしてもMoEの速度はほぼ変わらない。律速が演算だからだ。逆にDenseを速くしたければ帯域強化が効く。94%張り付いているから、帯域を増やせば理論上ほぼ比例して伸びる。M4→M5で帯域が同じ614 GB/sのまま、decodeが+9〜16%しか伸びなかった理由もここで説明がつく。帯域が同じならDenseのdecodeはほぼ同じで、伸びた分はNeural Acceleratorによる演算側の向上(とMoEの恩恵)なんだよね。

セクション画像

別の見方もできる。お店のレジに例えると、Denseは「レジが1台で客が列を作っている」状態。客を増やす(モデルを大きくする)と列が伸びるだけで、処理はレジ速度(帯域)で決まる。MoEは「客をいくつかのレジに振り分けている」状態で、ボトルネックはレジの振り分け処理(演算)側にある。レジの搬送ベルトを速くしても、振り分けが遅ければ全体は速くならない。ベンチ表を「何が律速か」で色分けして初めて、次に何を買えば速くなるのかが見えてくるんだよね。

帯域を食い潰す「長い文脈」の落とし穴

ただし注意も必要で、文脈長が伸びると数字は崩れる。oMLXコミュニティベンチのgemma-4-31b bf16の記録を見ると、4kコンテキストでTG 7.1 tok/sだったのが、32kで4.0、128kで1.6、195kで1.2 tok/sまで落ちる。KVキャッシュが膨らんで実効読み出しに上乗せされるからだ。DeepSeek V4 Flashも、短いプロンプトなら39.35 tok/sだったのが64kコンテキストで27.6 tok/sまで落ちる(antirezのds4 README実測)。MoEでも長文脈では帯域使用率が上がっていく。喉の詰まり具合は固定値じゃなくて、使い方によって変わるものなんだよね。

セクション画像

だから今日の実践は3つだ。まずベンチを見るときは、decode速度だけでなく「構造(MoEかDenseか)」「量子化」「コンテキスト長」の3点セットで確認する。次に自分の用途に合わせて律速を予測する。長文を食わせるならMoEでも帯域が効いてくるし、短いやり取りなら演算律速のMoEが圧勝する。最後に、「載るモデルの種類で体感が6倍変わる」という事実を前提に、モデル選びをサイズ順ではなく構造順に並べ直すこと。128GBという同じ器材でも、載せるものによって全く別のマシンになる。

数字は嘘をつかない。ただし、数字の隣に「測った条件」と「構造」が書いてあるときだけ。最後にひとつだけ視点を足すと、帯域使用率という考え方は「MacかGPUか」の機種論争を超えたところにある一般解でもあるんだよね。どのハードウェアでも「1トークンあたり何バイト読むか」を数えれば、そのマシンでの速度がほぼ見積もれる。今日の表がその証拠だよね。

次回は「通説の訂正」——「Macは帯域律速」が半分だけ正しい理由を、kamo78のmactopテレメトリとDeepSeek V4 Flash 34.1 tok/sの実測から読み解く。