128GB革命 #5 実測映像の力——ベンチ数字の裏側をYouTubeに見る
128GB革命 #5 実測映像の力——ベンチ数字の裏側をYouTubeに見る
コンビニでアイスを買うとき、私は容器の蓋を開ける前から中身の量をなんとなく想像するんだけど、実際には開けてみるまで分からない。パッケージの写真は常に美しく、実際の容量との間には小さな溝がある。ローカルLLMのベンチ数字も同じで、テキストで「58 tok/s」と書かれていても、それがどんな速度なのかは感覚として掴めないんだよね。今日はその溝を埋める人、Xで@bridgemindai、いわゆるBridgeMindというクリエイターの話をする。
数字が動画になる瞬間
BridgeMindはInstagram 2.5K以上のフォロワーを持つAI系クリエイターで、$5,399のM5 Max 128GBを自腹で購入して、Qwen3.6-35BとGemma4-31Bの実測を投稿している。2026年5月25日には「I have never seen speeds this fast」と書いた。この言葉、単なる感想に聞こえるけど、背景には具体的な数字がある。Qwen3.6-35B-A3BをQ4_K_M(約23GB)で走らせたときのdecodeが58 tok/s、Q8_0(約38GB)でも51 tok/s。この2本の動画は「量子化を落とすと速度が変わる」という理屈を、視聴者の目の前でターミナルに映す。買い物カゴにアイスを入れてもらう瞬間に立ち会える、というわけだ。
さらに独自の「Bridge Bench」というリーダーボードを運営していて、そこに実測値が積み上がっていく。個人クリエイターがベンチを「番組」にする例は少なくて、この構え自体が特徴的だよね。そしてDGX Spark GB10が37tpsで動くシーンを引用リポストし、「Apple税の代替を検討したがM5 Maxの方が速い」と評した。映像で確認した数字に基づいて判断する姿勢は、Redditの実測文化と同じ土俵に立ってる。個人的に面白いのは、Bridge Benchが「番組」として続いている点だよね。ベンチって普通、一度測ったら終わりで、翌週には誰も覚えてない。でも番組形式だと、新しいモデルが出るたびに同じ機材・同じ測り方で再挑戦するから、過去との比較が蓄積される。コンビニのアイスで言えば、毎年同じ夏に同じ容器で容量の比較記事を出してくれるようなもので、読者は「今年のQwenは去年のGemmaより詰め込みが良い」みたいな比較が初めてできる。個人がこれを続けている事実自体が、すでに一つの研究機関なんだよね。
なぜ動画なのか:Gemma4-31Bの23 tok/s
ここで一度、物理の話をする。LLMの1トークン生成は、モデル全体のパラメータをメモリから読み出す作業とほぼ同義で、decode速度はだいたい「メモリ帯域幅 ÷ モデルの実効サイズ」で決まる。M5 Maxの帯域は約614 GB/sだから、19GBのモデルをQ4で載せた場合の理論上限は614÷19≒32 tok/s。実際のGemma4-31B(Dense構造、Q4で19GB)の実測は23 tok/sで、帯域使用率はおよそ7割。この「7割」が動画で見えるのだ。ターミナルでtok/sの数字がカウントされる姿は、スペック表の数字より説得力が桁違いだよね。
ここで前回の地図を引っ張り出すと、$4kのDGX Spark(帯域約273 GB/s)で同じ19GBモデルを走らせた場合の理論上限は273÷19≒14 tok/s。19GBモデルなら「約614 GB/s vs 約273 GB/s」の差がそのまま体感速度の差として映像に残る。BridgeMindが動画でM5 Maxの速さを見せつけるのは、この物理が背景にある。「I have never seen speeds this fast」は感嘆ではなく、帯域2.25倍の物理の証言なんだよね。
一方で、23 tok/sは「速い」のか
話を戻す。Gemma4-31Bの23 tok/sを他の実測と並べると立体的に見えてくる。DeepSeek V4 Flash(MoE 284B-A13B、IQ2XXSで約81GB)の34.1 tok/s。Hermes3 70B(Dense、Q4_K_Mで42GB)の11 tok/s。Qwen3.5-122B-A10B(MoE、4bit、ピークメモリ71.9GB)の65.8 tok/s。この並びを見ると、decode速度を決めるのは「DenseかMoEか」と「モデルの実効サイズ」であって、動画で見える数字の裏には毎回アーキテクチャの設計思想がいる。BridgeMindの動画はこの差を「見える形」で提示してくれる。ターミナルのtok/sカウンタが数字を刻む速さそのものが、アーキテクチャの違いの可視化なんだよね。
MoEの利点はもう少し具体的に説明できる。Qwen3.6-35B-A3Bの「A3B」は1トークンあたりに活性化するパラメータが約3Bという意味で、実効サイズは23GBや38GBのファイルサイズよりずっと小さい。だから帯域614 GB/sのM5 Maxで58 tok/sも出る。一方DenseのGemma4-31Bは全部のパラメータを毎回読むから、19GBでも23 tok/sどまり。動画で2つのモデルを並べて再生すると、カウンタの刻み方がまるで違うのが一目で分かる。これが「数字の理由」を映像が語っている瞬間だ。ちなみにgpt-oss 120B(MoE、mxfp4で約65GB)だと72 tok/sまで出るから、MoEの伸びしろはまだある。同じ128GB機でも「何を載せるか」で速度が3倍以上変わる。アイスの容器で言えば、同じ冷凍庫に入れても中身の詰め方で解凍の速さが変わるようなもので、スペック表だけでは絶対に分からない差なんだよね。
エージェントを映す人たち
実測動画はBridgeMindだけじゃない。YouTubeの0x5am5は、M5 Max 128GBの上でOpenCodeやClaude CodeといったコーディングエージェントをoMLX経由で動かす実演を公開している。注目すべきは、彼が映しているのがベンチスコアじゃなくて「仕事の進み方」だという点。エージェント用途では、生成速度そのものより「指示を出してから動き始めるまでの待ち時間」が体験を決める。プロンプトの処理(prefill)が速いほど、エージェントはキビキビ動く。テキストのベンチはdecode速度を報告しがちだけど、エージェントの快適さはprefillとdecodeの両方で決まる。このあたり、動画で見ると「あ、ここで考えてるんだ」が可視化されるんだよね。
prefillの重みを示す数字も出しておく。第3回で紹介したantirezのds4では、DeepSeek V4 Flashのdecodeが短いプロンプトで39.35 tok/sなのに対し、コンテキスト64kでは27.6 tok/sまで落ちる。こうした数値の谷間は、テキストだけだと表の行として埋もれる。でも動画なら、コンテキストが伸びた瞬間にカウンタが失速する様子がそのまま体感として残る。数値の前後関係ごと「過程」として共有できるのが映像の強みだよね。エージェントの現場を考えると、この失速は体感の話を超えてくる。コードを書かせるとき、エージェントは数百行のファイルを丸ごとプロンプトに詰め込むから、コンテキストはすぐ64kに達する。つまりエージェント使いにとって「64kで27.6 tok/sまで落ちる」という数字は、遠い他人の話じゃなくて毎日の待ち時間そのものなんだよね。だから0x5am5の動画が役に立つ。スペック表は「短いプロンプトでの輝き」しか映さないけど、動画は夕方の疲れた顔まで映してくれる。
実践:読者が今日できること
では実践的な話。読者が今日できることは3つある。
- Xで@bridgemindaiをフォローして、M5 Max 128GBの実測動画をタイムラインに流し込む
- 同じモデル名でも量子化(Q4_K_MかQ8_0か)とコンテキスト長を必ず確認する。数字は条件が揃って初めて比べられる
- 動画で見た機種の妥当性は、llmcheck.netのリーダーボードで自分の環境に近い数値を確認してから判断する
動画で見た数字を鵜呑みにせず、条件を揃えてから比較する。これが「実測映像」を正しく消費する作法だよね。ちなみに「何を基準にフォローすべきか」が知りたいなら、答えはシンプルで、tok/s・メモリ使用量・動かしたモデルの量子化の3点セットを必ず添えている人物を優先する。数字を出さない発信は、どんなに上手い言葉でも氷の量を隠したアイスと同じなんだよね。
映像が埋める「数値の谷間」
最後に、映像の独自の価値について。テキストベンチは結果の数値を残すけど、到達までの挙動——最初の数秒のもたつき、コンテキストが伸びたときの失速、ファンの音——は記録に残らない。BridgeMindの動画は、その谷間を埋めている。DGX Sparkの37tpsのシーンを引用リポストする行為も、単なる数字の比較じゃなくて「動いてる姿」の比較だ。テキストは結果を報告し、映像は過程を共有する。2.5Kフォロワーの個人がベンチ番組を運営できて、別の個人がエージェントの仕事風景を撮れる。この観測網にM5 Max 128GBという器材が加わった、というのが今日の地図更新だよね。家電量産品ならメーカーが公開データを出してくれるけど、128GBという特殊な器材の世界はまだ誰も公式の性能表を用意してくれない。だから住人が自腹で買って、自分の部屋で撮って、数字と一緒に公開する。この非公式な観測網こそが現時点で最も信頼できる「性能表」なんだよね。パッケージの写真を信じるのはやめて、蓋を開けている人の動画を見に行こう。それが今日の結論でもある。
次回は122B MoEを65.8 tok/sで回すRedditベンチ職人たちの手法を、llama-benchの測定条件から読み解く。