← Back to Home
note.com ·

【LLLMパワーレポート #005】同じ397B、DL数はbpwで割れた

【LLLMパワーレポート #005】同じ397B、DL数はbpwで割れた

同じ397Bが4つに分裂――4種bpwのDL数を並べて見る

同じQwen3.5-397B-A17B-VQを、圧縮率の異なる4種類のbpwで配布しているのが、TheDrainFloristのリポジトリ群です。2026年9月10日時点の実測では、3.1bpwが2194DL、2.6bpwが1224DL、2.4bpwが2637DL、2.2bpwが2437DLとなっています。ダウンロード数の多い順に並べると、最多は2.4bpwで2637DL、続いて2.2bpwの2437DL、3.1bpwの2194DLという順になります。一方で、圧縮率が中間に位置する2.6bpwだけが1224DLにとどまり、4種の中で最も少ないという結果になりました。bpwが下がるほどDL数が増え、上がるほど減る、といった単純な順番にはならないところが注目点です。実際、最多の2.4bpwと末席の2.6bpwとの間には、実に1413DLもの差が開いています。いずれも同一の397Bモデルから派生した配布でありながら、量子化率の選択ひとつでダウンロード数がここまで分岐したことは、巨大モデルを利用する側の「どこまで削るか」という判断が、数字のうえではっきりと現れた結果だと見ることができます。

挿絵の説明
挿絵の説明

最多は2.4bpwの2637DL、次点と末席の差はどこから来るか

同じQwen3.5-397BのVQ版4種のうち、最多は2.4bpwの2637DLです。2位は2.2bpwの2437DL、3位は3.1bpwの2194DLで、この3つは数百DLの範囲に収まっています。ところが2.6bpwだけが1224DLと、末席とはいえ他の3種から大きく離れており、並べて見ると数字の割れ方に偏りがあります。

この差がどこから来るのか、資料にある数字の範囲で整理してみます。上位3種は「2.2bpw・2.4bpw・3.1bpw」と、圧縮率の低い側と高い側に散らばりながらも拮抗している一方、中間に位置するはずの2.6bpwだけが凹んでいます。もしDL数がbpwの高低だけに連動するなら中間が最大になるはずで、この結果は圧縮率そのもの以外の要因、たとえば公開後の経過日数や利用者層の選好などが効いている可能性を示唆します。ただし今号では編集部によるローカル推論の実測を行っておらず、DL数以外の裏付けは取れていません。あくまで並び方から読み取れる観察である点は、そのままお伝えしておきます。

いずれにせよ、同一モデルの4種がそろって4桁のDLを記録している事実は、巨大モデルの量子化バリエーションが一つの需要圏を形成していることを示す数字です。

挿絵の説明
挿絵の説明

bpwとは何か――bit単位の圧縮率を読者向けに嚙み砕く

重みを何ビットで保持するかを示すのがbpw(bits per weight)です。1つの重みに平均して何ビットを割り当てるかを表す値で、元の精度である16ビットから数値を削って表現することを量子化と呼びます。bpwの値が小さいほど1重みあたりの情報量を減らすため、ファイルは小さくなり、メモリの少ない環境でも動かしやすくなります。その一方で、削り方を誤ると出力の質が落ちる可能性があり、この点は一般に知られる量子化の性質としてご理解いただくのがよいでしょう。

本号で扱ったTheDrainFloristのQwen3.5-397B-A17B-VQでは、同じモデルから2.2bpw、2.4bpw、2.6bpw、3.1bpwの4種が配布されています。bpwは0.1刻み程度の違いでもファイルサイズと品質のバランスが変わるため、利用者は自分の環境に合わせて版を選ぶことになります。実際のダウンロード数を見ると、最多は2.4bpwの2637、次いで3.1bpwが2194、2.2bpwが2437、2.6bpwが1224という結果でした。同じ397Bという巨大モデルであっても、どこまで削るかという選択の違いが数字にはっきりと表れた形です。つまりbpwとは、圧縮の強さを1つの数字で示し、モデル選びの分岐点となる指標だと言えます。

数字を支えるランタイム――MLX・llama.cpp・Ollamaの最新版

量子化モデルのDL数という数字の裏側には、それを実際に動かすランタイムの存在があります。今号の索敵で確認できた主要ランタイムの最新リリースを、GitHubの実測に基づいて整理しておきましょう。

まずAppleシリコン向けのフレームワークであるMLXです。本体のml-explore/mlxはv0.32.2(2026年8月25日)、テキスト生成まわりを担うmlx-lmはv0.31.3(2026年4月22日)が最新となっています。mlx-lmの更新は今年4月で一段落しているように見えますが、これは資料上のリリース日から読み取れる事実の範囲です。

続いてggml-org/llama.cppはv0.4.0(2026年9月4日)に到達しました。GGUF形式のモデルを広く扱うランタイムとして、今週初めのリリースというタイミングが確認できます。

そしてollama/ollamaはv0.34.0(2026年9月5日)です。こちらも9月に入っての新版で、llama.cppとほぼ同時期に更新が重なっています。

なお、編集部によるローカル推論の実測は今号では実施していません。各バージョンでbpw別モデルの挙動がどう変わるかは、今後の検証課題として提案にとどめます。

特別付録:bpw早見表2026

「bpw早見表2026」として、本号で実測したQwen3.5-397B-A17B-VQの4種bpwとDL数を、あとで見返せる一覧の形に整理しておきます。

• 2.2bpw:DL 2437

• 2.4bpw:DL 2637(今号の最多)

• 2.6bpw:DL 1224

• 3.1bpw:DL 2194

すべてTheDrainFlorist公開のモデルで、取得日は2026-09-10 15:34 JSTです。並べてみると、密度を削るほど必ずDLが伸びるわけではなく、2.2bpwと2.4bpwが2000台後半から2400台で接戦になり、中間の2.6bpwだけが1200台まで落ち込む、という凹凸のある形になりました。

あわせて、この数字を支えるランタイムのバージョンも控えておきます。mlxはv0.32.2(2026-08-25)、mlx-lmはv0.31.3(2026-04-22)、llama.cppはv0.4.0(2026-09-04)、ollamaはv0.34.0(2026-09-05)です。いずれもGitHubの実測リリース情報です。

なお、bpwの選び方そのものの優劣を断定するデータは本号では取っていません。DL数はあくまで取得時点のスナップショットであり、この表は読者の比較用メモとして使うものです。

今号の工房から

今号では、HuggingFaceのMLXモデル更新からTheDrainFlorist氏のQwen3.5-397B-A17B-VQシリーズを取り上げ、3.1bpw・2.6bpw・2.4bpw・2.2bpwの4種についてダウンロード数を実測取得しました。取得日は2026年9月10日15時34分JSTで、いずれも更新は同日付でした。並べる前は圧縮率が低い(高bpwの)ほうが人気だろうと先入観を持っていたのですが、実際の数字は一様ではなく、この「割れ方」をどう読むかが本号の軸になりました。

なお、今号で編集部が実施したのは公開数値の実測取得までで、ローカル環境での推論検証は行っていません。生成品質の比較は記事内の数字には含まれない点は、あらかじめご了承ください。体感速度や品質の違いまで確認できれば話はもう一段深まると考えていますので、今後の検証としてローカル推論の実測を加えるのは提案です。

執筆環境の側では、各種ランタイムのリリース状況もGitHubから実測で確認しました。数字を眺めるだけでも面白いのですが、対応ランタイムの版を押さえておくと実際に動かすときの迷いが減るはずです。今後の号で検証体制をどうするかは、編集部内でまだ固まっていません。

今号の文章はクラウドモデルで生成し、編集部によるローカル推論の実測は行っていません。

元記事: https://note.com/keity717/n/n96a1b3a99860