Qwen3.8-Flash-NextをV100×2で毎秒88トークン、vLLM 0.30.0の確認点
この記事の要点
V100を2枚使い、Qwen3.8-Flash-Nextを256Kで毎秒約88トークンで動かした自己計測の中身と、vLLM 0.30.0で消えた設定、上げる前の確認手順をまとめます。
再生できない場合は YouTube で見る · チャンネル登録
9月24日に Qiita で、古い GPU の Tesla V100 を2枚使い、Qwen3.8-Flash-Next を256Kのコンテキストで毎秒約88トークン出した計測が公開されました。 同じ週に vLLM v0.30.0 が出て、環境変数や GPTQ まわりに、上げるだけでは動かなくなる変更が入っています。 この記事では、2本の中身と信頼できる範囲、手元で試す前の確認点を、動画を見ていない方向けにまとめます。
V100×2で毎秒88トークン、何が起きたか
計測したのは Qiita の投稿者で、数字はすべて投稿者の自己計測です。機材は Tesla V100 32GB を2枚(NVLink 接続)、Xeon Platinum 8260 を2基、メモリ314GB という、家庭用ではなくサーバ機の構成です。
モデルは MoE で、512個の専門家から毎回10個が動きます。GGUF は80GBで、専門家の部分は IQ3_XXS、それ以外は Q8_0 です。VRAM は合計64GBなので全部は載りません。27GBある層ごとの埋め込み表を、通常のメモリに mmap で置いたままにして、VRAM を専門家の重みに回しています。
速度は、短いプロンプトで毎秒88.2トークン。KV を64K埋めた状態で88.0、250K埋めても79.6を保っています。llama.cpp v0.5.0 へのパッチを当てる前は毎秒30.2で、64K埋めで35、250K埋めは測れないほど遅い状態でした。入力の読み込みも、64Kから250Kの区間で毎秒約150から606に上がっています。残り18万6千トークンを読む時間にすると約21分が約5分になる計算です。
注意したいのは、比べる相手が他の GPU ではなく、改造前の同じ機材だという点です。RTX 4090 や Mac、クラウドでの同モデルの数字は記事にありません。
2.92倍の内訳は MTP が最大
2.92倍のうち最も効いたのは、MTP を使った投機的デコードです。MTP は先の数トークンを予想する専用の頭で、3トークンを下書きして4トークン分をまとめて確かめます。この1手だけで毎秒51〜52になり、30.2からの比率は約1.7倍です。残りは、長文で読むブロックを上位512に絞る工夫と、V100向けの細かい調整の積み重ねです。
ここに落とし穴があります。一般に配られている GGUF には MTP の頭が入っていません。投稿者は元の約360GBのチェックポイントから約8GB分を取り出して、末尾に足しています。MTP を試すなら、頭の入った GGUF を選ぶところが先です。
信じていい条件と、試す前の確認
記事の条件を外すと、この数字は再現しません。
- 速くなるのは1スロット運用のときです。複数人が同時に使うサーバにすると、計測条件から外れます。
- パッチの変更は、温度0の出力が改造前とバイト単位で一致するものに絞られています。一方で、量子化による品質低下の数字(perplexity など)は記事にありません。llama-perplexity で別の量子化と同じ文章を比べてから使うのが安全です。
- 他人のパッチと GGUF なので、差分を読み、本番と別のマシンで試し、Hugging Face の SHA256 と照合してください。
環境の前提は CUDA 12.9.1 です。CUDA 13 は V100(Volta)に対応していません。なお投稿者は、NVLink ありの v2 パッチで平均120トークンとも追記していますが、計測条件を確認できていないため未確認です。
Mac については、ファイルサイズだけの単純計算で、統合メモリ96GBなら80GBは収まり、64GBでは収まりません。速度の実測はなく、このパッチは CUDA 向けなので Mac では効きません。
vLLM 0.30.0: 消えた環境変数と上げる前の確認
vLLM v0.30.0 は、公式リリースノートによると762コミット・315人が関わった大型更新です。DeepSeek-V4.1-Flash や GLM-5.3-Flash への対応、Qwen3.8-Flash-Next の専用カーネルが入りました。運用面では、再起動を短くする Fast Start(--load-format ipc_cache)と、KV をホスト側メモリへ逃がす HiSparse が追加されています。HiSparse の対象は sparse-MLA 方式のデコードに限られるため、自分のモデルが対象か先に確認が要ります。
本題は、上げるだけでは済まない変更です。
- 環境変数 VLLM_PREFIX_CACHE_RETENTION_INTERVAL と VLLM_MM_HASHER_ALGORITHM は環境変数から消え、設定項目へ移りました。
- scale-out を有効にする VLLM_ENABLE_SCALE_OUT_ENDPOINTS も消え、
--enable-scale-outフラグが必須になりました。 - GPTQ の g_idx(並べ替え情報)は無視され、関連するカーネルも削除されました。並べ替え付きで量子化したモデルは、上げる前に形式の確認が要ります。
- YaRN は、ベンダー別の指定で長さが二重に伸びていた不具合が直りました。その結果、自動で決まる max_model_len が短く出る場合があります。エラーが出ないぶん気づきにくいので、上げた後に値を見比べてください。
確認は、起動スクリプトに対して grep -rn -e VLLM_PREFIX_CACHE_RETENTION_INTERVAL -e VLLM_MM_HASHER_ALGORITHM -e VLLM_ENABLE_SCALE_OUT_ENDPOINTS . を1回実行するだけです。何も出なければ、環境変数の面ではそのまま上げられます。出たら設定項目かフラグに置き換えてから上げます。
GitHub には、特定の Qwen3.8 構成で出力が繰り返す、FlashInfer が無い環境で起動に失敗する、ソースビルドに実際は GCC 13 が要る、という3件の報告も出ています。いずれも未確認の利用者報告で、事実としては扱いません。自分の構成で再現しないかを、本番の前に確かめる項目として置いてください。
戻し方も先に決めます。今のバージョンを番号で固定し、コンテナならタグを残します。Fast Start で困ったら ipc_cache の指定を外せば元の読み込みに戻ります。誰がいつ上げ、いつ戻したかを記録に1行残しておくと、障害時に効きます。前後比較まで入れた作業の目安は30分ほどです(モデルの読み込み時間は別、動画のチャンネルとしての目安)。
残り3本は様子見・見送り・知っておくだけ
- Apple の LensVLM-9B は様子見です。文書を圧縮した画像から必要なページだけ展開して読む9Bモデルですが、モデルカードに評価の数値と商用可否の記載がなく、MLX での実行手順もありません。重みは BF16 で約18GB(9B×2バイトの単純計算)です。
- CLM-v0.1-8B は見送りです。Qwen3-8B の上に小さな頭を2つ載せた並べ替えモデルで、ライセンスは Apache-2.0。ただしベンチマークは開発元の自己申告で、比較相手の説明が薄い状況です。
- 足し合わせた入力でも LLM に線形性が見えるという論文は、知っておく程度で十分です。
今週の4本を「手元で動く実測」で並べる
4本を同じ軸で並べると、手元での実測が出ているのは V100 の記事の1本だけです。それも投稿者1人の自己計測にとどまります。vLLM 0.30.0 は数値より互換性の確認が先に来る更新で、LensVLM と CLM は誰かが回した実測がまだ見当たりません。つまり、どれも自分で測って確かめる話です。
今夜やること、電気代の概算
環境別に1手ずつ置くと、次のとおりです。
- Mac や GPU なし: 手持ちの GGUF で、llama-perplexity を使い量子化違いの品質を比べる。
- 自宅 GPU: 今のモデルで KV を64K埋めたときの速度を測る。
- V100 持ち: パッチを当て、記事と同じ2条件で測る。
- vLLM 運用: grep してから、検証環境で0.30.0に上げる。
電気代は記事にないので、部品の定格から上限を概算しました。V100 が1枚300W、Xeon が1基165Wで、2つずつ足して930Wです。1kWh 31円(全国家庭電気製品公正取引協議会の目安単価)で計算すると、フルに回して1時間約29円。毎秒88.2トークンなら100万トークンの生成に約3.1時間で、電気代は約91円です。実測の消費電力ではなく、メモリ・ストレージ・冷却の電力と機材の購入費は含みません。
出典
- 2×V100 で Qwen3.8-Flash-Next を 256K・約88 tok/s で動かす (Qiita)
- 量子化 GGUF とパッチ (Hugging Face・投稿者公開)
- vLLM v0.30.0 リリースノート (GitHub)
- apple/LensVLM-9B (モデルカード)
- Contrastive-LM/CLM-v0.1-8B (モデルカード)
- 論文: Your Transformer Can Hold Two Thoughts at Once
詳細は動画で
上げる前のチェックリストと、各スライドの表は動画と概要欄にあります。https://youtu.be/_WK1dzAidy8 ローカルLLMの更新は毎週まとめているので、続報を追いたい方はこのチャンネルをフォローしておいてください。