128GB革命 #14 日本語圏の底力——kamo78のテレメトリと、あきらパパの1.0
title: “128GB革命 #14 日本語圏の底力——kamo78のテレメトリと、あきらパパの1.0” category: “テクノロジー” eyecatch: “/assets/m5max/ep14-eyecatch.jpg” date: “2026-09-18”
コンビニのコーヒーマシンを想像してみてほしい。ボタンを押してから豆が挽かれる音、お湯が注がれる音、あのコップに溜まっていく音。全部を一度にやっているようで、実は内部では「挽く担当」と「注ぐ担当」が別々に動いているんだよね。ローカルLLMの話も、実はこれと同じ構造をしてる。追加学習もしない巨大なモデルが、質問ごとに「使う部品」だけを取り出して答えている——MoE(Mixture of Experts)と呼ばれる仕組みだ。そして日本語圏で、その内部で何が起きているかを最初に数字で見せた人がいる。Zennのkamo78さんだ。
テレメトリという名の「計器盤」
macOSにはmactopという、CPUやGPUの使用率をリアルタイムで表示するツールがある。車でいえば速度計と水温計だよね。kamo78さんの手法が画期的だったのは、この計器盤を推論の最中に覗き込んで、「いま足を踏み張っているのは帯域か、演算か」を切り分けたことなんだ。 これまでの通説は、「Apple Siliconはメモリ帯域がボトルネック」というものだった。128GBの統一メモリは美しいけど、帯域は~614GB/s。DGX SparkみたいなGPUマシンに比べたら半分以下。だから「Macは速くない」という結論がネットには溢れていた。 kamo78さんの実測は、これを半分だけ訂正した。MoEモデルのDeepSeek V4 Flash(IQ2XXS、約81GB)を動かしたところ、decode速度は34.1 tok/s出ていた。81GBものモデルが128GBのMacで「動く」だけでもすごいのに、秒間34文字も書いてくる。しかもこのとき、帯域はあまり使われていなかった。一方、従来型のDenseモデル、たとえばGemma4 31B(Q4、19GB)は23 tok/s、Hermes3 70B(Q4_K_M、42GB)に至っては11 tok/sで、こちらは帯域がほぼ張り付いていた。 つまり、MoEとDenseでは、「重いのは別の場所」なんだよね。MoEは演算(GPU)が、Denseは帯域が首を絞めている。同じ「128GBで動く」という一言でも、中身がまるで違う。以前の回で見たMoEとDenseの速度差(第7回)は、「なぜ」まで含めてここで初めて定量的に説明されたことになる。この区別を、一般のApple Siliconユーザーの記事として最初に示したのが日本語圏からだったことを忘れちゃいけない。 正直に言うと、ここまでの英語圏の議論は「速い遅い」の言い合いだったんだよね。Redditのベンチスレも、Xの実測投稿も、結局はtok/sの数字を並べて「うちの方が速い」とやっていた。kamo78さんの違うところは、速度ではなく「足回り」を見たこと。配管が詰まってるのか、エンジンが回りきってないのか。この切り分けができる人は、英語圏のどのベンチ職人にもいなかった。とほLabもまた、M5 Max 128GB上でMLX・Ollama・llama.cppという異なるエンジンを横並びで測る実験を重ねており、「道具の違いで同じモデルの速度が変わる」という地味だけど重要な検証を日本語圏で続けている。計測文化の層の厚さは、一人の英雄ではなく、こういう積み重ねでできるものだよね。
数字が語る日本語圏の測定文化
kamo78さんの記事の別の価値は、Qwen3.6-35B-A3BというMoEモデルを、量子化を変えて測っていることだよね。Q4_K_M(23GB)ではdecode 58 tok/s、prefill 1148 tok/s。Q8_0(38GB)ではdecode 51 tok/s、prefill 1177 tok/s。量子化を粗くすれば速い、という単純な話ではなく、Q4からQ8へ上げてもdecodeは約7 tok/sしか変わらない。これは「量子化を恐れるな」という実践的な後押しになる数字だ。 同じくgpt-oss 120B(mxfp4、65GB)ではdecode 72 tok/s。128GBのMacで、120B級のモデルが72 tok/sで流れる。この数字だけでも、2年前の常識が書き換えられたことがわかる。
自作モデルを出した男——あきらパパ
測定するだけでなく、自らモデルを作って配る人も日本語圏から出た。Xの@akira_papa_IT、あきらパパさんだ。生成AI活用エンジニアとして知られ、自作ローカルLLM「akira-papa 1.0」をMLXとGGUFの両形式で公開している。Apple SiliconユーザーはMLXを、ほかの環境のユーザーはGGUFを、それぞれ落としてすぐ動かせるように、という配慮だ。 ローカルLLM界隈には「ダウンロードして動かして終わり」の文化がある。でもakira-papa 1.0は、形式を二つ用意するところから始まって、「自分の環境で動くかどうか」の敷居を下げる設計になっている。Windowsの人にも、Macの人にも、同じ「あきらパパ製」の味を試してもらう。なんだか、町のパン屋さんが「食べられるだけの量の小さなパック」と「家族用の大きなパック」を並べるのに似てるんだよね。中身は同じでも、手に取る人の状況に合わせて形を変えている。 自分のハンドルネームをそのままモデル名にするセンス。私はこれ、「泡立て器を自作する料理人」のノリだと思うんだよね。料理が好きすぎて、道具まで作っちゃう。あきらパパさんはM5 MaxでQwen3.8-27B Abliteratedの動作報告もしており、単なる「作って終わり」じゃなく、実機での挙動まで晒している。モデル置き場に「作りました」だけ置く人と、「うちの環境ではこう動いた」まで書く人。後者の方が、同じ土俵で試そうとする人たちの助けになるのは明らかだよね。
「AI秘書」構成と、手元に置く判断
日本語圏のもう一つの強みは、「速さ自慢」より「運用の知恵」に厚みがあることだ。 muhenkou.netの実機検証では、M5 Max 48GBでgemma4を「AI秘書」として動かし、opencodeやClaude Codeと組み合わせる構成が示された。ポイントは、機密データをクラウドに出さずに済む構成として実証したこと。速さの数字はここでは脇役で、主役は「手元に置く」判断そのものだ。 同じように、youtoyさん(Qiita/KDDI)は、LM Studio 0.43以降で追加された「LM Studio MLX (Apple M5)」ランタイムの導入手順を初期のBeta指定込みで丁寧に残している。新しいランタイムが動かない、と数日悩む人が出るタイミングで、初期はBeta指定が必要だった、という記録があるのとないのとでは、後続の人の時間の使い方が変わる。こういう「つまずきポイントの記録」は、派手さゼロだけど、コミュニティのインフラだよね。レシピサイトに「小さじ1は5ml」と書いてある人がいるおかげで、初めての料理でも失敗しないのと同じ構造だ。
個の枠を超えていく
日本語圏の動きは、個人発信にとどまらない。 ItmediaやGigazineが伝えた分散推論の話では、2台のMac StudioをThunderbolt 5で連結し、RDMA over TB5で最大3.2倍の高速化が報告されている(tumf.devの実装解説も)。2台合わせて128GBという構成の意味は、一人で一台を持てない人が「友達の家のMacと繋いで遊ぶ」という、日本の家庭のスケールで体感できるところにあると思うんだよね。 そして、前回(#13)までのDGX Spark論争は、いわば英語圏の巨大マシン対決の話だった。でも日本語圏で起きているのは、もっと地に足のついた進化だ。自分の環境で計器を覗き、数字を残し、モデルを作り、秘書として使い、時には机の上の2台を繋いでみる。革命は、巨大な研究所からだけでなく、机の上からも起こせる——それを「測定と配布」の形で示したのが、この回の結論だよね。
出典
kamo78「M5 Max のローカル LLM ベンチ — MoE は GPU 性能、Dense はメモリ帯域幅がボトルネック」Zenn(zenn.dev/kamo78/articles/ds4-m5max-benchmark / 2026年・mactopテレメトリ実測: DeepSeek V4 Flash 34.1 tok/s / Qwen3.6-35B-A3B Q4_K_M 58 tok/s・Q8_0 51 tok/s / gpt-oss 120B 72 tok/s / Gemma4 31B 23 tok/s / Hermes3 70B 11 tok/s)あきらパパ(@akira_papa_IT)のX投稿・note(akira-papa 1.0 / M5 Max でのQwen3.8-27B Abliterated動作報告 / 2026年)muhenkou.net(M5 Max 48GBでのgemma4「AI秘書」実機検証 / 2026年・ブログ記事)youtoy(Qiita/KDDI・LM Studio 0.43 MLX (Apple M5) ランタイムの導入記録 / 2026年・Qiita記事)itmedia / gigazine / tumf.dev(Mac Studio 2台・RDMA over TB5で最大3.2倍の分散推論 / 2026年・報道記事と実装解説)一次調査: ~/m5max-series/research-2026-08-16.md(2026-08-16・データ少佐/scotty) 次回は「消えた3人」——コミュニティ調査で名前だけ先行し、Web上に痕跡が確認できなかった3つのアカウントを、誠実な開示の形で扱うよ。