← Back to Home
テクノロジー ·

128GB革命 #11 M4 MaxからM5 Maxへ——数字が語る「世代交代」の正体

128GB革命 #11 M4 MaxからM5 Maxへ——数字が語る「世代交代」の正体

128GB革命 #11 M4 MaxからM5 Maxへ——数字が語る「世代交代」の正体

朝の駅の階段、エスカレーターに乗らずに歩く人と普通に乗る人、どちらも同じ改札を抜けるのに、届く時間には確かな差がつくんだよね。乗り続けたら脚は鍛えられるし、階段の上り下りの「読む時間」みたいなものも段々慣れて速くなる。ローカルLLMの世界にもそれとよく似た「同じ距離を進むのにかかる時間の差」があって、M4 MaxからM5 Maxへの持ち替えで、それがどれだけ縮まるのか。今日は一年前の機種からの乗り換えを考える人に一番大事な、文章を書く速さと、長い資料を読み込む速さの二つがどう変わったのかを、コミュニティの実測値だけで見ていくんだよね。

前回はノート筐体の呪いの話をした。同じM5 MaxでもMacBook ProとMac Studioでは3分の連続decodeで明確な実力差が出て、薄型筐体は98度まで到達してクロックを削られ、冷却台で風を送るとMoEの速度がだいぶ持ち直したという話だった。今日は視点をガラッと変えて、世代交代の話。M4 MaxとM5 Maxを並べて、同じモデル・同じ量子化・同じプロンプトで走けさせた実測があるんだよね。出典はRedditのr/LocalLLMに投稿されたu/purealgoさんのMLXベンチ表。両機とも128GB・40コア・同一プロンプトで512トークン上限・複数回平均という、個人実測とは思えないほど条件が揃った比較なんだよね。

差がつく場所は「読む」側

まず結論から言うと、世代交代で上がったのは二つの速度で、上がり方が全然違う。生成(Gen)は模型が答えを書く速さで、こちらは9%〜16%の着実な向上。プロンプト処理(PP)は模型が質問文を読む速さで、こちらは17%〜46%もの大幅な向上。つまりM5のNeural Acceleratorは「長いコンテキストを読む」仕事で最大の差をつける。文章を書くのが少しだけ速くなって、資料を読むのがぐっと速くなる。エージェント用途みたいに巨大なコンテキストを毎回投げる使い方では、体感はこのPP側に大きく出るんだよね。

u/purealgoさんの表は5モデル分あるから、まず書く速さ(Gen・tok/s)の列を見てみよう。GLM-4.7-Flash-4bitがM4で90.56・M5で98.32。gpt-oss-20b MXFP4-Q8が121.61から139.34。Qwen3.5-9B-4bitが90.81から105.17。gpt-oss-120b MXFP4-Q8が81.47から93.11。Qwen3-Coder-Next-4bitが91.67から105.75。どれも一割前後の改善で、ここから「インフレ」を期待する人には物足りない規模感なんだよね。書く仕事は前世代でも十分に熟成されていて、そこをさらに伸ばすのは物理的に難しい、というのがこの列の読み方だ。

読む速さは最大46%動く

ところが読む速さ(PP・tok/s)の列になると数字の温度帯が変わる。GLM-4.7-Flash-4bitは174.5から204.8でプラス17.3%。gpt-oss-20bは624.0から792.3でプラス27.0%。Qwen3.5-9Bは241.1から333.0でプラス38.1%。gpt-oss-120bは301.5から355.1でプラス17.8%。そしてQwen3-Coder-Next-4bitは210.9から306.9でプラス45.5%。ほぼ1.5倍。同じモデル・同じメモリ・同じプロンプトで、読む仕事だけがこれだけ動く。ここが今日の核心で、生成の小幅改善と並べると、M5の新しい演算機構(Neural Accelerator)が誰のために作られたのかがはっきり見える。エージェントのように巨大なリポジトリや長いドキュメントを毎回読み込ませる使い方では、待ち時間の大半がこのPP側に溜まっているんだよね。だから実感としては「返信は少し速くなった」より「最初の返信が来るまでの待ち時間が半分近く減った」のほうが大きい。手に取るなら、この差を自分の用途に当てはめてみることだ。

もう一つ、この表の読み方で大事なのが前提条件だ。両機とも128GB・40コアという最高構成同士の比較で、メモリ容量もコア数も完全に同じ。差として出てくるのは純粋に世代の違いだけ。それにプロンプトは512トークン上限・複数回平均という縛りで、瞬間的なブレを潰してある。個人のベンチ投稿でありがちな「速い回だけ貼る」やらかしがなくて、この表は何度見ても誠実なんだよね。数値の信頼性という点では、この連載で扱ってきたどの実測よりも条件が綺麗に揃ってる。だからこそ、この表が示す「書く仕事は一割・読む仕事は最大四割半」という非対称は、たった一人の実測とは思えない重みで効いてくる。コミュニティにこんな資産が積み上がってる限り、個人の検証は公式のベンチマーク資料より有用になり得るっていうのが、この連載を続けていて一番しみじみするところなんだよね。

この差の意味を考えるには、第7回で見た帯域使用率の話が役に立つ。MoEモデルは614GB/sの帯域を15〜22%しか使わずGPU演算律速、Denseモデルは94%まで張り付いて帯域律速だった。演算律速のモデルは計算器の速さ改善を素直に受け取りやすい。u/purealgoさんの表を見ると、PP向上の大きいQwen3-Coder-Next(プラス45.5%)やQwen3.5-9B(プラス38.1%)がまさにMoEの軽いモデルで、生成側は全部が一割前後の並び。M5の新しい演算機構は、帯域に余裕のある仕事で本領を発揮するみたいなんだよね。

ここで思い出してほしいのは、kamo78さんの実測でのprefillの数字だ。第7回でも触れたけど、gpt-oss 120Bのprefillは912 tok/s出ていて、decodeの72 tok/sより一桁大きい。LLMの仕事には「答えを書く時間」と「前提を読む時間」の二つがあって、長いコンテキストを扱うほど後者の方が配分が大きくなる。RAG検索で大量の文書を食わせるとか、コードエージェントでリポジトリ丸ごと読ませるとか、そういう使い方では実質的な待ち時間の大半がPPで消えてる。だからPPの+17〜46%というのは、体感速度の改善としてはdecodeの数字よりずっと大きく効くんだよね。買い替えの判断でdecodeの数字だけ見て「大して変わらないじゃん」と結論するのは、実は本の表紙と目次ばかり気にして本文を読む速度を見ていないのと同じで、ちょっともったいない。

逆に言えば、帯域に張り付くDenseモデルでは世代交代の利得は限定的だろうと予想できる。表の5モデルは全部でMoEか軽量寄りだから、Gemma4 31BのようなDense勢が同じだけ伸びるかは実は未知数で、ここはあくまで推定の話にとどめておく。帯域律速の仕事は、計算器を新しくしても帯域の天井がそのまま効くからだ。買ってから「思ってたほど速くならない」とならないためにも、自分の載せるモデルがどちらの律速なのかを先に確かめておくのがいい。MoE中心ならM5への持ち替えの利得は大きく、Dense中心なら持ち替えの動機は弱くなる。数字はそう言ってるんだよね。

どう読むかを一句で言えば「世代交代は読む速さを買え」。エージェントに巨大なリポジトリを読ませる人には体感差が大きく、チャットで少しずつ書かせる人には控えめ。もう一つ大事なのは、この差は第9回・第10回の熱の話で揺れる数字だということ。ノート筐体で98度まで行けばクロックが削られて効果は目減りする。世代交代の利得をフルに受け取るには、冷却という土台が先なんだよね。

今日できることは三つ。MLXで走けている人は同じ条件でM4とM5を並べて自分の用途の数字を出してみること。u/purealgoさんの投稿のように条件を揃えた表を残すことが、このコミュニティ一番の資産になること。そしてモデル選びでは、PP向上率の大きいMoE軽量モデルから試すこと。読む仕事が多い使い方ほど、世代交代の利得を大きく受け取れるんだよね。

さて、機種選びの現実的な話もしておこう。M4 MaxとM5 Maxの差は、フラッグシップ同士の比較では上に書いた通り。じゃあ「M4 Maxの128GBを中古で安く買う」のと「M5 Maxの128GBに一新する」のとどちらが得なのかというと、これは用途次第で、長い文書を食わせるエージェント運用が本業ならM5のPP向上は確実に効く。逆にチャットと軽いコード補完が中心なら、M4 Max中古のコスパはまだまだ捨てたもんじゃない。もう一つ見逃せないのが、この差が積み重ねで効く場面だ。バッチで百件の文書を読ませる夜間ジョブみたいな使い方では、1件あたりのPP短縮が百件分きっちり溜まって、終わる時刻が目に見えて縮む。新品同士で迷っているなら、次世代のPP向上は間違いなく正解側の要素だ。

今日のまとめの代わりに、一言だけ足すなら「読み込みこそ世代交代の主戦場」ということになるんだよね。生成の一割向上は地味だけど、PPの四割半は明確な進化で、しかもその差が一番大きく出るのはエージェントという、これから伸びる使い方の側にある。一年前の機種が急に古くならないのがローカルLLMの良いところでもあり、それでも演算機構の進化は確実に「読む仕事」を加速させている。数字を自分の用途に当てはめて、納得できるタイミングで乗り換えればいいんだよね。

次回はいよいよDGX Sparkとの対決。帯域614GB/s対273GB/s、Mac派の根拠を数字で組み立てる。

=== metadata

episode: 11

next: DGX Spark論争(前) 帯域614 vs 273・Mac派の根拠

improvement_reflection: 前回レビューの①(h2直後figure)は挿入方式を維持しつつ挿入後に即座に位置補正を入れて対応

videos: GriXfu4tL30 / tn2Hvw7eCsw / q5oaA3mcMD4