Vllm
- ローカルLLM 週次Qwen3.8-Flash-Next量子化版は最小72.5GB、同じ重みで出力も5割変わる Qwen3.8-Flash-Nextの量子化GGUFは最小72.5GB。GLM-5.3-Flashは93.1GB。推論の実装が変わると同じ重みでも出力が最大5割変わる検証もあわせて紹介します。
- ローカルLLM 週次MacでLagunaが動く: Ollama・llama.cpp・vLLM同時更新の要点と落とし穴5つ 2026年7月24〜30日のローカルLLM動向まとめ。OllamaのMac向けLaguna対応、llama.cppの投機的デコード、vLLM v0.26.0の要点と、更新時に踏みやすい落とし穴5つを整理します。