Qwen3.8-Flash-Next量子化版は最小72.5GB、同じ重みで出力も5割変わる
この記事の要点
Qwen3.8-Flash-Nextの量子化GGUFは最小72.5GB。GLM-5.3-Flashは93.1GB。推論の実装が変わると同じ重みでも出力が最大5割変わる検証もあわせて紹介します。
再生できない場合は YouTube で見る · チャンネル登録
オープンウェイトの大型MoEモデルが相次いで量子化版GGUFを公開した週です。量子化しても容量は100GB前後から下がらず、同じ重みでも推論の実装次第で出力が変わることも分かってきました。
この記事では、2026年8月25〜27日に公開されたQwen3.8-Flash-Next、GLM-5.3-Flashの量子化版と、推論バックエンドの違いで出力が最大5割食い違うという検証をまとめます。
8月25日から27日に何が公開されたか
この期間に出た新モデルは3本ですが、そのままローカルマシンに載るものはありません。8月25日にApple製MLXがv0.32.2にアップデートされ量子化MoE演算とGQAデコードが最適化、26日にvLLMがv0.28.0を公開、同日unslothがQwen3.8-Flash-NextとGLM-5.3-Flashの量子化版GGUFを公開。27日にTencentがHy4-previewを公開しましたが公式の実行構成はGPU8枚前提です。
今日すぐ試す価値があるのはMLXの更新とQwen3.8-Flash-Nextです。
Qwen3.8-Flash-Next: 量子化しても最小72.5GB
Qwen3.8-Flash-Nextは総パラメータ125B、推論時に実際に動くactiveパラメータは6BのMoE(Mixture of Experts)構成です。activeは1トークン生成時に計算される重みの量を指します。
配布GGUF(llama.cpp系ランタイムのモデル格納形式)のサイズは、unslothのモデルカードによると最軽量の1bit量子化(UD-IQ1_S)で72.5GB、2bit(UD-Q2_K_XL)で78.9GB、4bit(UD-Q4_K_XL)で111GB、無圧縮BF16では354GBです。
ここが落とし穴です。activeが6Bでも総パラメータ分の重みはまるごとメモリに載せる必要があり、32GBのGPU1枚には収まりません。128GB級のシステムメモリかSSDへの退避が前提で、16GBや32GBのMacは対象外です。
速度はZennの個人検証(RTX 5090+DDR5 128GB、追試前のコミュニティ実測)によると2bit版で毎秒43〜48トークンでした。効いたのはMoEエキスパートをGPU側に寄せる設定と、物理コア数に合わせたCPUスレッド数とのことです。
この規模の重みを公開しているのはいまのところオープンウェイト系だけで、GPT系やGemini系は同規模の重みを公開しておらず自前ホスティングの選択肢自体がありません。
GLM-5.3-Flash: active 18Bでも最小93.1GB
GLM-5.3-Flashも同じくunslothの量子化版が公開されました。構成は総パラメータ320B、推論時のactiveが18Bで、ライセンスはMITです。
activeが18Bと聞くと18GB前後で動きそうに見えますが、実際の最小GGUFサイズは1bit量子化でも93.1GB、2bitで109GB、4bitで200GB、無圧縮BF16では642GBです。理由はQwen3.8-Flash-Nextと同じで、動かない部分も含め総パラメータ320B分の重みをすべてメモリに置く必要があるためです。
Qwen3.8-Flash-Nextとの最小サイズの差は約20GB。同じ128GB級のマシンなら先に試す価値があるのはQwen3.8-Flash-Nextで、余裕分がコンテキスト長や量子化レベルの選択肢に直結します。GLM-5.3-Flashを選ぶのは、MITライセンスが要件になる改変・再配布の前提がある場合です。
自前で持つか既存APIを使い続けるかの目安は、月間の総トークン数にAPI単価を掛けた金額と機材の減価償却月割り額を比べ、前者が上回れば自前ホスティングを検討する、というものです。
同じ重みでも実装次第で出力が変わる
今週の本題はここです。海外の技術フォーラムLevel1Techsに2026年8月16〜27日にかけて投稿された連載検証によると、ローカル環境で動かしたモデルが公式デモより出来が悪く感じられる原因の一部は、モデルではなく推論の実装側にありました。
検証では、同じモデル・同じ重みのまま注意機構計算ライブラリ(FlashAttention 2、Flash Inference、Triton Attention)を入れ替えるだけで、選ばれる単語が最大約5割食い違いました。
ほかにも、KVキャッシュ(生成途中経過の保持)を4bitまで量子化すると長い入力ほど劣化しツール呼び出しが失敗する例、重み自体の量子化方式では8bitのINT8方式が最も精度を保ち最も低ビットな方式では失敗率が5割を超える例、GPU分割数(2枚で失敗・4枚で成功)によって結果が変わる例が報告されています。ただし投稿者自身、統制条件下での数学的な比較であり実際の生成がどこまで崩れるかまでは示していない、と留保しています。
手元で今日から確認できるのは、使っている推論バックエンドの確認、KVキャッシュ量子化を4bitから8bitへ上げての比較、量子化前後の出力比較、ツール呼び出し用途での低ビット量子化回避の4つです。
クラウドAPIは量子化方式が非公開で確かめる手段がありませんが、自前で動かす場合はそこを自分で管理できます。
MLXとvLLMの更新、様子見の2モデル
残り4件を簡単に触れます。MLXのv0.32.2はApple Silicon向けに量子化MoE演算とGQAデコード、Metal処理を最適化した更新で、GGUF読み込み検証や量子化まわりの不具合修正も含みます。
vLLMのv0.28.0は共有エキスパートの扱いを見直しGPU1枚あたり約17GiBのメモリが浮きますが、Transformersを5.15へ更新しbitsandbytesを外部プラグイン化する破壊的変更も入っており、アップデート前に検証が必要です。
TencentのHy4-previewは総パラメータ7700億、activeが490億で最大100万トークンのコンテキストとApache 2.0ライセンスを備えますが、公式の実行構成はGPU8枚並列前提で個人環境では現実的ではありません。MiniMaxの高速化LoRAは動画生成モデル向けで、ローカルで動画生成する場合にのみ関係します。
3モデルを同じ軸で比べる
3モデルを同じ軸で並べると、総パラメータは125B・320B・770B、推論時のactiveは6B・18B・49Bです。最小GGUFサイズはQwen3.8-Flash-Nextが72.5GB、GLM-5.3-Flashが93.1GBで、activeが3倍違ってもサイズ差は3割弱にとどまります(Hy4-previewは公式GGUF提供がなく比較対象外)。
つまりactiveは推論速度の目安、最小GGUFサイズはマシンに載るかの目安で別々に見る必要があります。ライセンスはQwen3.8-Flash-Nextがqwen-community-1.0、GLM-5.3-FlashがMIT、Hy4-previewがApache-2.0。想定実行環境は前者2つが128GB級システムメモリ、Hy4-previewがGPU8枚並列構成です。
まとめ
今週公開された3本のモデルは、いずれも賢さそのものより機材と実装の話でした。Qwen3.8-Flash-Nextは128GB級のメモリがあれば条件付きで実用に乗り、GLM-5.3-FlashとHy4-previewは手元の容量次第で様子見という位置づけです。クラウドAPIを中心に使っている場合、今週のリリースに急いで対応する必要はなく、次の機材更新や自前ホスティング検討時の判断材料として押さえておけば十分です。
もう一点は、同じ重みでも実装によって品質が変わるという検証結果です。検証環境と本番で推論バックエンドが揃っていないと出力が変わり得るため、評価をやり直す前にまず実装を揃えて確認する方が手戻りが少なくなります。ローカルLLMの制約は、モデルの性能そのものよりメモリと実装差に移ってきています。
出典
- unsloth/Qwen3.8-Flash-Next-GGUF (HuggingFace)
- unsloth/GLM-5.3-Flash-GGUF (HuggingFace)
- tencent/Hy4-preview (HuggingFace)
- MLX v0.32.2 リリースノート (GitHub)
- vLLM v0.28.0 リリースノート (GitHub)
- RTX 5090 + DDR5 128GBでの実測 (Zenn / ほーりーふぉっくす)
- 推論スタック差の検証 (Level1Techsフォーラム)
- 関連動画: 新型Mac Studio / Mac mini (M5系) の特集
あわせて動画もどうぞ
今回扱った数値の詳細や、量子化前後の出力比較の実演は動画にまとめています。気になった方はこちらもご覧ください。