128GB革命 #12 DGX Spark論争(前)——帯域614対273、Mac派が最初の一手を握る理由
スタバでサイズを迷うあの数秒、好きなんだよね。トールにするか、ヴェンティにするか。中身は同じコーヒーなのに、カップで満足感が変わる。実はいまローカルLLM界隈で起きている「DGX Spark対M5 Max」の論争も、構造はこれにすごく似てる。どちらも128GBのメモリを積んだマシンなのに、「速い」というたった一つの言葉が、正反対の二つの実測を生んでる。片方は「Macの方が速い」。もう片方は「場面によりDGXが13〜45%速い」。どちらの数字にも嘘がない。それなのに結論が割れてる。前編の今回は、Mac派が「勝つ」と信じる根拠を、一次データだけを頼りに追ってみるよ。
冒頭でひとつだけ前置きさせてほしい。この連載は第11回でM4 MaxからM5 Maxへの世代交代を数字で検証したときもそうだったけど、すべての数値を一次データに戻って確認してから書くスタイルを貫いてる。論争ものほど数字の伝言ゲームで崩れるからだよね。今日も出典は末尾に全部載せるよ。
論争の原材料は「帯域」ひとつに尽きる
メモリ帯域という言葉、馴染みがない人にはピンとこないかもしれないけど、コーヒーで言えばストローの太さだよね。どんなに濃いコーヒーがカップに入っていても、ストローが細ければ一口に吸える量は決まってしまう。LLMの文章生成(decode)は、まさにこのストロー作業なんだよね。モデルの重みをメモリから読み出して、トークンを一つ出す。この流れの律速は、ほぼメモリ帯域で決まる。
ここで数字を並べる。M5 Maxのメモリ帯域は約614GB/s。DGX Sparkは約273GB/s。比率は2.25倍。これが論争の第一の材料だよね。DGX Sparkも128GBのLPDDR5xを積んではいるんだけど、帯域が273GB/sにとどまる。帯域がdecode速度の物理的上限を決める以上、バッチ1の単発decodeではDGX Sparkは原理的にM5 Maxに勝てない。この見立ては、Hacker Newsの理論派も、lmsysの一次実測も、同じ方向を指してるんだよね。
しかも電力の数字もすごい差で並んでる。M5 Maxは最大約270W、待機時25W。DGX SparkはTDP約1000W、待機時でも120W。待機電力だけでM5 Maxの全力に届く。コーヒーで言えば、こちらは静かにトールを飲んでいるのに、隣の席では巨大なマシンが常時回ってる、そんな感じかな。この電力比は後編でコストの話につながっていくんだけど、まず「物理で3倍」という感覚だけ持って帰ってもらえたら十分だよね。
ランニングコストの話も一応押さえておくと、100万トークンあたりの費用はM5 Maxが約1.75ドル、DGX Sparkが約1.70ドルで、ほぼ同じ。電力差これだけあるのにコストが拮抗してるのが面白いところで、初期投資と電気代の構造が違うからだよね。拡張性だと話が変わって、M5 MaxはThunderbolt 5でのマルチノード構成が可能、DGX SparkはConnectX-7の200Gbpsネットワークを備える。ここの比較はまた後編でちゃんと扱うよ。
lmsysが計った「20.5」という数字
一次データの暴力というべき実測がある。lmsysが2025年10月13日に公開したDGX Spark一次レビューだよね。条件はLlama 3.1 8B・FP8・SGLang・バッチ1。prefillは7,991トークン毎秒。ところがdecodeは20.5トークン毎秒。prefillとdecodeの落差がすごくて、レジ打ちは一瞬なのに商品を袋に詰めるのが極端に遅い店員さんがいる、みたいな光景なんだよね。
比較として並べるとはっきりする。RTX 5090の実測はprefill 8,519・decode 205。Mac Studio M3 Ultraはprefill 10,108・decode 215。バッチ1のdecodeに限れば、DGX Sparkの20.5はRTX 5090の10分の1にも届かないし、M3 Ultraとは10倍以上の開きがある。帯域273GB/sという物理が、そのまま数字になった形だよね。prefillなら7,991と十分実用的なのに、出力フェーズに入った瞬間に息が止まる。読み込むのは速いのに、話し出すと歯切れが悪い人、いるよね。あれに近い。
さらに惨い記録もある。DeepSeek-V4-FlashのvLLM移植版がDGX Sparkで2トークン毎秒未満。一方、antirezがM5 Max向けに2週間で書いた自作エンジンds4は、第3回で紹介した通り39.35トークン毎秒を記録してる。284B級の巨大MoEを量子化して載せるというこの連載の主戦場では、移植先で2未満という数字を並べられると、「Mac派」が声を上げる理由はわかるよね。
コミュニティの空気も、いまはMac側に寄ってる
Xの空気を見てみる。@jun_songはハードウェアガイドで両者を階層分けしていて、4千ドルのDGX Sparkに対して7千ドルのM5 Maxという位置づけを作ってる(第4回で扱ったあの階層だよね)。@bridgemindaiにいたっては「DGX GB10の37tpsを見てApple税の代替を検討したけど、M5 Maxの方が速い」とまで書いてるんだよね。2.5千人以上のフォロワーを持つ人が公言するこの発言は、界隈の空気をかなり正確に映してる。
Reddit r/LocalLLaMAのDGXスレでも「1人用ならMac、サーバーならDGX」「訓練するならDGX一択、推論だけならMac」というコメントが定番化してる。感情論じゃなくて、実測文化がこの空気を作ってる点が面白いところだよね。根拠のないブランド信仰ではなく、自分のワークロードで計った人が数字で語る。スレが数百票単位で盛り上がるのは、それだけ多くの人が同じ問いを手元で試してる証拠でもある。
Mac側の並列処理の最高記録も一応押さえておくと、oMLXコミュニティのgemma-4-31b bf16でバッチ8倍・27.9トークン毎秒(3.99倍にスケール)。実はこの数字の意味は後編で効いてくる。DGX Sparkがバッチ32で368トークン毎秒を出す話と並べると、論争の輪郭が一気にくっきりするんだよね。どうスケールするか、がこの論争の隠れた主題なんだよね。
でも「13〜45%上」も、やっぱり嘘じゃない
ここまで聞くとMac勝ちで決まりに聞こえるんだけど、そう単純じゃないんだよね。presenc.aiの比較では「場面によりDGX Sparkが13〜45%速い」という実測が載ってる。これはプロダクション設定・CUDAスタック前提の条件付き数字だけど、嘘じゃない。lmsys自身のレビューでも「バッチングを使うとき、特に小さいモデルをサーブするときにこそDGX Sparkは輝く」と書かれてるし、「試作と実験向きで、本番向きではない」という総括も、裏返せば試作と実験の範囲では有力な選択肢という意味だよね。
なぜ帯域2.25倍のMacが、場面によっては負けるのか。理由は主に4つある。量子化形式の違い(NVFP4やFP8対Q4_K_MやQ8)。バッチサイズの違い(1対32)。ワークロードの違い(単発decode対並列スループット)。そしてCUDAとMetalというスタックの成熟度。つまり「どっちが速いか」は、「何を載せて、何人で使うか」で判定が反転する。比較条件が揃わないまま数字だけ並べると、矛盾は錯覚として残る。lmsysの実測ではバッチ32で368トークン毎秒、prefillは7,949とほぼ落とさず、並列で線形に近い伸びを見せてる。さらにDGX Sparkには1 PFLOPのFP4演算能力があって、FP4/FP8での訓練が原生対応。LoRA微調整8Bは約3.5時間で終わるところ、M5 Maxでは約14時間かかる。投機的decodeのEAGLE3を使えば最大2倍というソフトウェア的な緩和策もある。その「DGX派の反撃」を全部、後編に取っておくよ。帯域で勝つか、スケールで勝つか。次回、決着の数字を見に行こう。今日の分はここまで。読んだあとに一度でいい、自分のマシンが「何人分」で動いてるか想像してみてほしい。それだけで、この論争の半分が手に入るよ。
出典
- lmsys org「NVIDIA DGX Spark 一次レビュー」(2025-10-13): https://lmsys.org/blog/2025-10-13-nvidia-dgx-spark/
- presenc.ai「DGX Spark vs Mac Studio M5 Max 比較」: https://presenc.ai/research/nvidia-dgx-spark-vs-mac-studio-m5-max
- NVIDIA開発者フォーラム「DeepSeek-V4-Flash vLLM移植 <2 t/s」: https://forums.developer.nvidia.com/t/deepseekv4-flash-hybrid-quant-1x-dgx-spark-antirezs-optimized-128-gb-mlx-recipe-ported-to-vllm-for-gb10/369584
次回予告: 第13回はDGX Spark論争・後編。バッチ32で368tps、18倍の並列スケールとEAGLE3の実力、「条件付き勝者表」で論争に決着をつけるよ。