Quantization
- ローカルLLM 週次Qwen3.8-Flash-Next量子化版は最小72.5GB、同じ重みで出力も5割変わる Qwen3.8-Flash-Nextの量子化GGUFは最小72.5GB。GLM-5.3-Flashは93.1GB。推論の実装が変わると同じ重みでも出力が最大5割変わる検証もあわせて紹介します。
- ローカルLLM 週次Qwen3.8-27BはMacで動くのか。17.7GBで動く条件と思考モードの効果を整理 Qwen3.8-27Bを実機で検証。Q4_K_Mで17.7GBに収まる条件、思考モードによる精度変化、Ollama 0.32.15の高速化、dense対MoEの速度差をまとめました。