128GB革命2 2016票のスレと数字だけを投下する男
128GB革命 #2 2016票のスレと、数字だけを投下する男
行列のできる店には、だいたい理由があるよね。看板が立派とか、広告を打っているとかじゃない。店主が誰にも見られない早朝から同じ仕込みを続けてきた、その積み重ねだ。ネットのコミュニティも構造は同じで、投稿に票が集まるとしたら、派手さではなくその人物が日々積んできた仕事への信頼があるからなんだよね。2026年3月11日、Redditのr/LocalLLaMAに「M5 Max just arrived - benchmarks incoming」という投稿が立った。M5 Maxが届いたからベンチマークを撮る、という短い予告だ。これが最終的に2016票を集める、このコミュニティ史上最大のスレッドに育つ。前回の地図で言えば心臓部にあたる場所で、何が起きたのか。今回はこの一本のスレを解剖する。
スレを開くと、そこには数字しかない
2016票というと、何か豪華なレビュー記事を想像するかもしれない。ところが実際にスレを開くと、拍子抜けするくらい簡素なんだよね。並んでいるのは mlx_lm.generate の実行ログそのもの。モデル名、量子化の指定、コンテキスト長、そして出てきた tok/s。解説も感想も装飾もない。「数字だけ」を投下して、後はコメント欄に放り投げる。このスタイルが2016票を呼んだ。
面白いのは、このスレが単発の花火じゃなかった点で、投稿者のu/cryingnekoは以前から同じ作法でベンチを投稿し続けていた。M3 Ultra 512GBという上位機で3大モデルを比較する実測も出している。つまり人々は初見の新人に票を投じたのではなく、ずっと同じ仕事を続けてきた職人の一投に票を集めた、という構図だよね。人気店の行列とまったく同じ理屈。
比べてみるとより面白いのが、同じ2026年3月22日に立ったもう一本のスレだよね。u/affenhoden氏による「Round 2」は、llama-benchという標準ツールでの測定に統一して、プリフィル速度や量子化ごとの比較、MoEモデルの追加まで丁寧に揃えた、いわば模範的なベンチスレだった。票は119。2016票の17分の1だ。つまりこのコミュニティが求めているのは、論文のような完璧さじゃない。機械を買った本人が、その目で見て、すぐ晒す生の第一報の熱なんだよね。
そして調査で一番驚いた発見がここにある。このu/cryingnekoの正体は、oMLXの開発者、jundot氏本人だった。oMLXというのはApple Silicon向けの高性能MLX推論サーバーで、この分野では誰もが知る基盤ソフトウェア。その作者が自分の道具の名前を出さず、ごく普通のユーザーとして「届いたから計ります」と機械のログを貼る。道具を作った人間が、その道具を使う現場に立つ。この素朴な構図が、オープンソースの健康さそのものなんだよね。
oMLXという土台の上の38万行
少しだけ技術の話をしよう。MLXはAppleがMac向けに提供している機械学習フレームワークで、ユニファイドメモリを活かしてGPUからRAMを直接叩ける設計になっている。oMLXはこのMLXの上に、実運用向けのサーバー機能と最適化を載せた実行基盤だ。jundot氏はr/oMLXでLightning MTPという推論高速化、oQeという量子化方式、カスタムカーネルなどの改良を継続的にリリースし続けている。Lightning MTPは次のトークンをひとつずつ予測するのではなく複数をまとめて当てに行く方式で、生成の待ち時間を縮める仕組み。oQe量子化は精度をできるだけ落とさずにメモリ使用量を削る技術だ。用語はここでは名前だけ覚えてもらえれば十分で、効果のほどは実測データを扱う第7回以降で検証する。
数字だけの文化を語る上で外せないのが、oMLXのコミュニティベンチマークの存在だよね。omlx.ai/benchmarks には、世界中のユーザーが自分のマシンで計った実測が38万行以上蓄積されている。匿名の誰かが、自分の構成を明示して、数字を投稿する。それが何年も積み重なった海だ。M5 Maxの40コア構成でフィルタをかけると、たとえばgemma-4-31bのbf16版が4kコンテキストで生成7.1 tok/s、プリフィル687 tok/sという具合に、機種とモデルと条件が揃った数字だけが淡々と読める。38万行という規模は、個人のレビュー記事が何百本集まっても到達しない密度なんだよね。
ただしこの海、読み方を間違えると溺れる。同じgemma-4-31bでも、コンテキストを128kまで伸ばすと生成速度は1.6 tok/sまで落ちる。逆に8並列のバッチ処理にすれば27.9 tok/sまで伸びる。条件が変われば数字は別物になる。この当たり前を、スレのコメント欄にいた人たちは身をもって突き止めていた。
コメント欄の金脈を掘る人たち
2016票のスレ本体よりも、実は密度が高いのがコメント欄なんだよね。一番の金脈はu/ConformalFuelTankで、前世代のM4 Max 128GBでllama-benchの標準測定を公開した。Qwen3.5-122B-A10Bの4bit量子化が、4106トークンのプロンプトで65.85 tok/s。ピークメモリは71.9GB。コンテキストを32kに伸ばしても54.9 tok/s、メモリ76.4GBで動いた。122Bクラスの巨大モデルがノートPCのメモリに収まり、しかも会話速度を超える。128GB機の「何が載るか」を実測で示した決定打だった。Qwen3-Coder-Nextの8bit版が87〜89GBで動くという報告まである。
世代をまたいだ数字も出てくる。u/DumperandumperはM3 Max 128GBでQwen3.5-122Bの5bitを100kコンテキストで30 tok/s。u/fanoushはM4 Maxの48GB構成でQwen3.5-27Bの4bitを27 tok/s。つまり122Bを動かせない狭いマシンでも、アーキテクチャを1つ落とせば実用速度が出る、という買い物の指針がコメント欄から読み取れる。専門誌の記事が書かない種類の知恵が、票でも賞金でもなく共有されている。
中でも刺さったのがu/arthwareの指摘だよね。MLXの表示では57 tok/s出ているのに、プリフィルを含めた実効速度は8.5kコンテキストで3 tok/sしかない。理由は、生成を始める前のプリフィル処理が全体の時間の94%を食っているから。画面に出る数字は生成速度だけで、待ち時間は含まれない。つまりカタログの速度を鵜呑みにすると、長い文書を食わせた瞬間に体感が壊れる。この「表示速度の罠」を暴いたのは、派手な検証セットじゃなくて、コメント欄の一行の実測だった。
金脈はスレ一本の中にも収まらない。u/_derpiii_氏の「M5 Max 128GB Owners - honest take」は94票を集めた所有者の本音集で、数字よりも満足と後悔の生の声が集まる場になっている。u/chimph氏の「128gb M5 Max for local agentic ai?」は、プライバシーを理由にクラウドAIを避けたい人が、128GB機でエージェント運用が成り立つかを問う相談スレだ。u/purealgo氏に至ってはM4 MaxとM5 Maxの両方を手元に置いて自作ベンチを回し、世代間の比較表を公開している。2016票という心臓の周りに、こうした細い血管が張り巡らされてはじめて、ハブはハブとして機能するんだよね。
数字だけの文化が守っているもの
どうしてこの界隈では解説のない数字の羅列が尊重されるのか。考え直すと、それはフェアさの装置なんだよね。解説がつくと数字は物語に変わる。都合のいい条件だけが前景に出て、都合の悪い落ち込みは後景に追いやられる。広告はその最たるもので、ピーク速度だけを大きく掲載する。ところが生の実行ログには物語がない。速い場面も、128kで1.6 tok/sに沈む場面も、等しく並ぶ。jundot氏がログをそのまま貼る作法を貫いたのは、自分の道具に都合の悪い数字も出てくるからこそ、だと思う。
この文化を支える土台として、調査側の限界も正直に書いておく。Redditの本文はログイン壁の向こう側にあるため、今回の調査ではArctic Shift APIという過去投稿アーカイブを使って回収した。リアルタイムの最新コメントまでは取れていない場合がある。それでも2016票の中身とコメント欄の数字が確認できたのは、アーカイブの力と、この文化そのものがすべてを公開しているおかげなんだよね。
読者が今日からできることも具体的にある。まずomlx.ai/benchmarksを開いて、自分が買おうとしている機種、たとえばM5 Maxの40コアでフィルタをかける。次に動かしたいモデル名で絞り込む。すると量子化ごとの実測が並ぶので、128GBに載るか、何tok/s出るか、コンテキストを伸ばしたらどこまで落ちるかが、購入前に分かる。レビューを待つより早い。そしてr/oMLXとr/LocalLLaMAのスレには、本文よりコメント欄に金が埋まっている。掘ってみてほしい。
次回は、Redisの作者antirez氏が2週間で書き上げた単一Cファイルの推論エンジンds4。284Bの巨大モデルを128GBのMacで走らせた男の実測に迫る。