# Qwen3.8-27BはMacで動くのか。17.7GBで動く条件と思考モードの効果を整理

- 公開日: 2026-08-23
- URL: https://ainewsdaily-site.pages.dev/posts/20260823-local_llm-t1/
- 動画: https://www.youtube.com/watch?v=PXbBmm6zRsw
- シリーズ: local_llm
- タグ: localllm, qwen, ollama, quantization, moe

> Qwen3.8-27Bを実機で検証。Q4_K_Mで17.7GBに収まる条件、思考モードによる精度変化、Ollama 0.32.15の高速化、dense対MoEの速度差をまとめました。


## 今週の結論

2026年8月13日から20日にかけて、ローカルで動かせるオープンウェイトのモデルとその周辺ツールに9件の動きがありました。中身まで踏み込む価値があったのは3件です。1つ目は、27B(270億パラメータ)のdenseモデルQwen3.8-27Bです。4ビット系の量子化Q4_K_Mをかけると重みは17.7GBまで下がり、統合メモリ32GBのMacや24GBクラスのGPU1枚で動く範囲に収まります。2つ目は、「思考モード」、答えを出す前に考える過程を書かせる設定を使うと、運営者の自作テストで平均スコアが73.3から82.1、上限を伸ばすと85.4まで上がったことです。3つ目は、ランタイムのOllamaがv0.32.15で、最初の1トークンが返るまでの時間を995ミリ秒から524ミリ秒まで縮めたことです。

この記事では、この3件を中心に、実際に手元で動かすときの条件と、思考モードやMoE(専門家の一部だけを動かす構造)を使うときに踏みやすい落とし穴を整理します。

https://youtu.be/PXbBmm6zRsw

## 8月13日から20日に何が起きたか

起点は8月5日です。Qwen3.8-27BのリポジトリがHugging Faceに作られ、14日に重みが確定しました。同じ13日には、unslothによるGGUF版(llama.cpp系のランタイムで使う格納形式)が公開されています。このGGUF版は632万ダウンロードで、本家リポジトリの209万に対して約3倍です。同じ日にFP8版(230万ダウンロード)も出ており、DeepSeekからは総パラメータ1.65TのDeepSeek-V4-Pro-0813がMITライセンスで公開されました。こちらは手元で動かせる規模ではありません。

15日にOllama v0.32.14、18日にMITライセンスのOrnith-1.5-35B-A3B(総36B、活性化するのは3B分のMoE構造)、19日にOllama v0.32.15が続きます。20日時点では、Hugging Faceのトレンド上位をQwen3.8-27Bの派生モデルが占めています。そして23日、運営者が同じマシンでdense 27BとMoE 35B-A3Bの生成速度を比べたところ、2.8倍の差がついています。理由は後述します。

## Qwen3.8-27Bは手元で動くのか

モデルカードによると、Qwen3.8-27BはApache-2.0ライセンスのdense(すべての重みが毎回動く構造)27Bで、画像と動画も入力に使えます。コンテキスト長(一度に読める量)はネイティブで262,144、YaRNという拡張技術で100万まで伸ばせます。思考モードは既定でオンで、reasoning_effortという設定値で深さを調整できます。この設定名はCodexの推論深度の考え方に近く、コーディングエージェントの文脈に馴染みがある方には理解しやすい構造です。MCP経由でローカルモデルをオフライン時のフォールバック先に組み込む使い方も選択肢に入ります。

4ビット系のQ4_K_Mでは重みが17.7GB。24GBクラスのGPU1枚や統合メモリ32GBのMacに収まります。8ビット系のq8_0では30GBになり、32GBのMacでは他の作業に使える余裕がほとんど残りません。入手はOllamaでのpull、またはunslothが配布するGGUF版リポジトリからの取得の2通りです。

公式ベンチ(自己申告値である点に注意)では、実際のバグ修正を解かせるSWE-bench Proで61.7、指示への追従を測るIFBenchで79.5と、いずれもOpus 4.6 Maxの53.4、62.5を上回ります。一方、端末作業を測るTerminal Bench 2.1は73.0対78.2、難問セットのHLEは30.8対40.0で下回ります。全項目で上回っているわけではなく、得意な領域が違うと見るのが妥当です。

## 思考モードとdense対MoEの実測

運営者はVRAM 96GBのGPU1枚、Ollama 0.32.13、量子化Q4_K_Mの条件で、精度と速度を別々に測定しています。精度は8月10日から14日、数学・総合知識・理系・コード生成の4分野を各15〜50問の自作セットで測定したもので、公式ベンチとは母集団が異なります。

思考モードを切った状態の平均は73.3でした。思考モードを入れて出力上限を8192トークンにすると平均82.1、上限を24,000まで伸ばすと85.4です。数学は53.3から73.3へ、コード生成は82.5から95.0へ上がりました。量子化を8ビットのq8_0に上げても平均は74.3で、思考なしからわずか1ポイント差にとどまり、速度は7.7 tok/sまで落ちます。精度を上げたいときは、量子化を上げるより思考モードの方が効果的です。

ただし思考モードは出力の上限を消費します。出力上限512トークンで3回投げたところ、Qwen3.8-27Bは3回中2回、MoEのqwen3.6:35b-a3bは3回中3回、答えが返らないまま終わりました。思考の過程だけで1,200〜1,800字ほどを使い、枠が尽きるためです。思考モードを使う場合は出力上限を大きく取る必要があります。

速度面では、dense 27Bと活性3BのMoE(qwen3.6:35b-a3b)を同じマシンで比較すると、中央値で21〜23 tok/s対61 tok/sと2.8倍の差がつきました。理由は1トークンを作るたびに読む重みの量です。denseは毎回17.7GBすべてを読みますが、MoEは活性部分の数GB分しか読みません。ただしMoEがメモリを節約するわけではなく、qwen3.6:35b-a3bが載せる重み自体は23.9GBとdenseより多いです。

Macでの生成速度は、17.7GB×22 tok/sからおよそ390GB/sの実効帯域を使っていると見積もれます。統合メモリの帯域をこの数字で割ると機種ごとの上限が概算できます。M4 Max(546GB/s)なら22〜25 tok/s前後、M2 Max(400GB/s)なら16〜18 tok/s前後、M4 Pro(273GB/s)なら11〜12 tok/s前後という計算です。実機で測った値ではなく理論上の帯域からの推定である点に注意してください。

## Ollama 0.32.15で応答が速くなった

Ollamaは8月19日にv0.32.15を公開しました。効果が出ているのは最初のトークンが返るまでの待ち時間です。解決済みのモデル情報をリクエストをまたいでキャッシュする変更が入り、公式の計測では995ミリ秒から524ミリ秒と約半分に縮まっています。8月15日のv0.32.14とあわせて、Qwen3.8を先頭以外に置いたシステムメッセージへの対応も揃いました。同じモデルに繰り返し問い合わせるローカルアプリでは効果が見込めますが、モデルを毎回切り替える使い方では効果が薄いと考えられます。

## 今週の落とし穴4つ

1つ目は、思考モードが出力の枠を食うことです。出力上限を小さくしたまま思考モードを使うと、答えが返らずに終わることがあります。

2つ目は、思考モードがすべてのモデルに効くわけではないことです。gemma4:12b-it-qatでは、総合知識を測るMMLU-Proが66.0%から40.0%に下がりました。50問中、答えが打ち切りになった数が2問から29問に増えたことが原因です。思考モードを使う前に、自分が使うモデルで一度測っておく必要があります。

3つ目は、MoE構造がメモリの節約にはならないことです。速いのは1トークンごとに読む重みの量が少ないためで、載せる重みの総量はdenseより多い場合もあります。

4つ目は、派生モデルのダウンロード数が品質の保証にはならないことです。無検閲をうたう版や安全装置を外した版もトレンド上位に並んでいますが、品質と安全性は検証されていません。業務利用を考える場合は、まずApache-2.0で公開されている本家から検討するのが無難です。

## 4モデルを同じ物差しで比べる

今週動きのあった4モデルを、型と規模、量子化後の重み、生成速度、ライセンスの4軸で並べます。Qwen3.8-27Bはdenseの27Bで17.7GB、21〜23 tok/s、Apache-2.0です。qwen3.6:35b-a3bは活性3BのMoEで23.9GB、61 tok/s、こちらもApache-2.0です。Ornith-1.5-35B-A3Bは同じ活性3B構造でMITですが、量子化後のサイズと速度は運営者側でまだ測定できていません。DeepSeek-V4-Pro-0813はMITですが、総パラメータ1.65Tと手元で動かす規模ではないため比較の対象から外れます。

このほか、FP8版・NVFP4版といった変換版、z-labによる推測デコード系のDFlash2、Ollama v0.32.14でのWebP画像対応など、名前だけ触れておく動きもありました。近日提供予定とされるQwen Cloudのホスト版は、クラウド提供のため手元で動かす前提のこの記事の対象からは外しています。

新しいオープンウェイトのモデルは、本家のリポジトリより先にGGUF版などの変換版から広まる状態が続くと考えられます。次に出る主要なオープンウェイトで、本家のダウンロード数が変換版を上回るようなら、この見方は外れです。

## 出典

- [Qwen3.8-27B モデルカード](https://huggingface.co/Qwen/Qwen3.8-27B)
- [unsloth の GGUF 版](https://huggingface.co/unsloth/Qwen3.8-27B-GGUF)
- [Ollama v0.32.15 リリースノート](https://github.com/ollama/ollama/releases/tag/v0.32.15)
- [v0.32.14 → v0.32.15 の差分](https://github.com/ollama/ollama/compare/v0.32.14...v0.32.15)
- [DeepSeek-V4-Pro-0813](https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813)
- [Ornith-1.5-35B-A3B](https://huggingface.co/ornith-ai/Ornith-1.5-35B-A3B)

思考モードの設定値や実測条件の詳細、Mac機種別の概算などは動画本編でも解説しています。ローカルLLMのニュースは平日更新のこのチャンネルで継続して取り上げています。

