← Back to Home
テクノロジー ·

128GB革命 #16 128GBに載るモデル完全地図——81の候補から59に絞る、LLMCheckの選び方

LLMCheckリーダーボードで読み解く、128GBに収まる81モデル→59種の選び方。順位と速度は別の軸。

128GB革命 #16 128GBに載るモデル完全地図——81の候補から59に絞る、LLMCheckの選び方

128GB革命 #16 128GBに載るモデル完全地図——81の候補から59に絞る、LLMCheckの選び方

中古カメラを買いに行く話をしよう。店員に「予算はどれくらいですか」と聞かれて「30万円」と答えると、最初に返ってくるのは性能の話じゃなくて「レンズはどれを揃えたいですか」なんだよね。ボディ一つとっても、対応レンズが全部載るわけじゃなくて、マウントという物理的な枠があって、その枠に収まる組み合わせだけが選択肢になる。同じお金があっても「載るか載らないか」で世界は先に分岐する。

ローカルLLMもまったく同じ構造をしてる。M5 Max 128GBという「ボディ」を手に入れた人の最初の問いは「何が動くの?」で、その答えを一枚の表にまとめてくれているのがLLMCheckというリーダーボードなんだよね。今回のデータは2026年8月16日時点の調査レポート(データ少佐によるM5 Max 128GBコミュニティ調査)のベンチマーク頁から取っている。まず結論の数字から言うと、128GBで収まるモデルは81中59種。81の候補のうち59だけが選択肢として残る、という世界だよね。

前回(第15回)は「消えた3人」の話で、コミュニティに名前だけ漂っているアカウントをどう誠実に扱うかという話をした。今回は一転して、ちゃんと数字で載るか載らないかが判定できる世界の話。こっちのほうが精神衛生上ずっと楽で、でも意外と「選び方」でつまずく人が多いんだよね。

81中59という数字の正体

LLMCheckのM5 Max 128GB対応リーダーボードでは、128GBで収まるモデルは81中59種とされる。一見「7割も載るなら余裕じゃん」と思うかもしれないけど、この数字は逆に読むほうが正しい。2割強のモデルは最初から選択肢にないし、載る59種の中でも「快適に動くか」は別の話だからだよね。

だからキャメラのマウントと同じで、最初にやることは「載らないものを外すこと」。そして外したあとのリストを「速度」と「適合度」で並べ直すことなんだよね。

リーダーボードの上位数行を読む

ここからが本題。スコア上位の並びはこうなってる。Qwen3.8-27B(71)が1位、DeepSeek V4 Flash(70・community実測39tok/s)が2位、KAT-Coder-V2.5(70)とMaple Preview 20B(70・281tok/s)とQwen3.6-27B(70)が続く。そして詳細テーブルのトップ10はこちら。

  • 1位 DeepSeek V4 Flash:284B MoE・39 tok/s・capability 47/50・ライセンスMIT
  • 2位 Qwen3.8-27B:27.8B・29 tok/s(推定)・capability 46/50・Apache 2.0
  • 3位 Inkling-Small:276B MoE・22 tok/s・capability 46/50・Apache 2.0
  • 4位 Qwen3-235B-A22B:235B MoE・18 tok/s・capability 46/50・Apache 2.0
  • 5位 Qwen 3.6-27B:27B・30 tok/s・capability 44/50・Apache 2.0
  • 6位 Laguna S 2.1:118B MoE・26 tok/s・capability 43/50・OpenMDW
  • 7位 Muse Glimmer 30B:30B・27 tok/s・capability 42/50・Apache 2.0
  • 8位 KAT-Coder-V2.5:35B MoE・52 tok/s・capability 39/50・Apache 2.0
  • 9位 Qwen 3.6-35B-A3B:35B MoE・48 tok/s・capability 38/50・Light MDW
  • 10位 Nemotron 3.5 Lightning:30B MoE・60 tok/s・capability 36/50・OpenMDW

この表、実は2つの読み方ができる。1つ目はスコア順に読む読み方。もう1つは「速度」で読み直す読み方。10位のNemotron 3.5 Lightningは60 tok/sで、1位のDeepSeek V4 Flash(39 tok/s)より速い。8位のKAT-Coder-V2.5(52 tok/s)も9位のQwen 3.6-35B-A3B(48 tok/s)も、上位陣より速い。つまりリーダーボードの順位は「総合点」であって「快適さ」ではないんだよね。キャメラで言えば、ミラーレスのカタログ順位と、手ブレしない軽さは別の軸って話に近い。

速度の実際——コミュニティ実測と突き合わせる

リーダーボードの数字をそのまま鵜呑みにするのは危険で、コミュニティの実測と突き合わせるのが定石になってる。というのも、LLMCheckの数字の一部には「推定(estimated)」マークが付いていて、調査レポートも「llmcheckの一部は推定マーク付き。kamo78・Reddit実測・ds4 READMEは一次データ」と明示してるんだよね。

具体例を挙げる。Qwen3.8-27Bの29 tok/sは推定値だけど、同じモデルをMacで実際に動かしてる動画がコミュニティにあって、それが「16GBから48GBのMacで動かす方法」という実践的な内容。128GBより小さいメモリでも動くんだから、128GBなら余裕で載る、という読み方ができる。逆に言うと128GB機の本命はもっとデカいモデルだよね。

その「デカい側」の代表がDeepSeek V4 Flash。kamo78氏のZenn記事の実測では、MoE 284B-a13B・IQ2XXSで約81GBというサイズで34.1 tok/s。ds4 README(antirez氏の実測)では短いプロンプトで39.35 tok/s、64kコンテキストで27.6 tok/s。リーダーボードの39 tok/sはこの実測と整合してる。

同じ128GBでもモデルの構造で世界が変わるのは第7回で話した通り。MoE(DeepSeek V4 FlashやQwen 3.6-35B-A3Bなど)は15〜22%しか帯域を使わずGPU演算が律速、Dense(Gemma4 31B・Hermes3 70Bなど)は帯域に張り付く。Gemma4 31B(Q4・19GB)は23 tok/s、Hermes3 70B(Q4_K_M・42GB)は11 tok/s。Q4_K_Mで23GBのQwen 3.6-35B-A3Bは58 tok/s、Q8_0で38GBにすると51 tok/s。サイズを上げてもMoEは速いままでいられる、というのがMoEの強みなんだよね。

122Bクラス——「載る」の上限値を更新する話

128GBの選択肢として特別なのが122Bクラス。u/ConformalFuelTankのM4 Max 128GB実測では、Qwen3.5-122B-A10B(4bit・71.9GB)が65.8 tok/s出てる。16kコンテキストで60.6 tok/s、32kで54.9 tok/s。メモリは73.8GB→76.4GBに増えるけど、まだ収まってる。

さらに調査レポートのLLMCheckインデックスには、M5 MaxでQwen3-235B-A22B(Q4・128GB限界)が18 tok/s(推定)とある。これは「128GBでギリギリ載る」世界の最上段で、快適さはともかく「載る」こと自体に意味がある。マウント適合性の上限値を実際に確かめる人が必ずいる、という話だよね。

ここまでの話を整理すると、128GBの選択肢は3つの帯に分かれる。「27〜35BのMoE(40〜60 tok/s・普段使い)」「70〜122Bクラス(11〜66 tok/s・本気運用)」「235B〜284Bのギリギリ層(18〜39 tok/s・最前線)」。全部が同じ128GBに載る。キャメラで言えば、レンズキット、単焦点、でかい望遠が全部同じバッグに入る状態だよね。

選び方の実践——capabilityとライセンスという2軸

じゃあ実際どう選ぶか。LLMCheckのテーブルは「capability」(適合度・50満点)と「ライセンス」という2軸を持ってる。

capabilityは47/50(DeepSeek V4 Flash)から36/50(Nemotron 3.5 Lightning)まで分布してて、上位10モデルの中ではかなり密度が高い。実はこれ、スコア順に読むと分かりにくいんだけど、速度で並べ替えると傾向が見えてくる。50 tok/s超えの3モデル(Nemotron 3.5 Lightning・KAT-Coder-V2.5・Qwen 3.6-35B-A3B)のcapabilityは36〜39と、スコア上位陣より低め。逆にcapability上位(47・46)は低速寄り。つまり「賢い」ものほど遅く、「速い」ものほどcapabilityが下がる傾向が読み取れる。完璧なモデルはなくて、軸をどれ取るかの話になるんだよね。

ライセンスを見ると、上位10のうち6つがApache 2.0、MIT・OpenMDW・Light MDWが残りを分け合う。商用利用や再配布を考えるとこの軸は無視できない。キャメラで言えば「レンズの生産が保証されてるか」に近い話で、ボディ(ハード)は長持ちするのに対応レンズ(モデル)の供給が途切れると資産価値が変わるからね。

今日できること

読者が今日できることとしては、まずLLMCheckのM5 Max 128GB対応リストを開いて、81中59という数字を自分の目で確認すること。次に候補を「速度」と「capability」と「ライセンス」の3軸で並べ替えること。実測値が欲しいときは、推定マーク付きのLLMCheck数字をkamo78のZenn実測やoMLXコミュニティベンチ(38万行)と突き合わせること。oMLXはM5 Max 40cでフィルタできるから、自分のマシンに近い条件の数字が引ける。第15回の改善メモに従い、今回は順位に必ず速度を添えて書いた。順位だけ並べると「1位が最速」と誤読されるからだよね。実際はNemotron 3.5 Lightningの60 tok/sが最速で、リーダーボードの順位と快適さは別の軸なんだよね。

次回予告

次回第17回は連載最終回。「まとめ」の代わりに「次の問い」で締めくくります。

出典

  • DeepSeek V4 Flash実測34.1 tok/s(IQ2XXS・約81GB)・Qwen3.6-35B-A3B(Q4_K_M 23GB・58 tok/s / Q8_0 38GB・51 tok/s)・Gemma4 31B(Q4 19GB・23 tok/s)・Hermes3 70B(Q4_K_M 42GB・11 tok/s)——kamo78(Zenn・2026年)
  • DeepSeek V4 Flash 39.35 tok/s(短prompt)・27.6 tok/s(64k ctx)——antirez ds4 README(2026年・GitHub)
  • Qwen3.5-122B-A10B 65.8 tok/s(4bit・71.9GB・4k ctx)・60.6 tok/s(16k)・54.9 tok/s(32k)——u/ConformalFuelTank(Reddit r/LocalLLaMA・2026-03-22前後のスレッド)
  • LLMCheckリーダーボード(M5 Max 128GB対応・81中59種・上位10モデル表・Qwen3-235B-A22B 18 tok/s推定)——llmcheck.net(2026年8月・調査時点・一部「推定(estimated)」マーク付き)
  • oMLXコミュニティベンチ38万行以上・M5 Max 40cフィルタ——omlx.ai/benchmarks(2026年8月時点)
  • 128GB革命シリーズ第7回(MoE/Dense帯域律速)・第15回(自己改善メモ)——note.com/keity717(2026年9月)