# MacでLagunaが動く: Ollama・llama.cpp・vLLM同時更新の要点と落とし穴5つ

- 公開日: 2026-07-31
- URL: https://ainewsdaily-site.pages.dev/posts/20260731-local_llm-t1/
- 動画: https://www.youtube.com/watch?v=Soaxl15g-BM
- シリーズ: local_llm
- タグ: localllm, ollama, llamacpp, vllm, ai

> 2026年7月24〜30日のローカルLLM動向まとめ。OllamaのMac向けLaguna対応、llama.cppの投機的デコード、vLLM v0.26.0の要点と、更新時に踏みやすい落とし穴5つを整理します。


2026年7月24日から30日のローカルLLM関連の動きをまとめた記事です。今週は新モデルよりも、モデルを動かすランタイム側が主役でした。Ollama・llama.cpp・vLLMの3系統が同時に高速化と品質修正を進めており、更新する理由がはっきりある1週間です。

https://youtu.be/Soaxl15g-BM

## 今週の全体像 (7/24-7/30)

取り上げたのは9件です。

- 7/24: Mage-Flow (Comfy-Org発の画像系モデル)
- 7/25: Ollama v0.32.4 (MLXエンジンがLagunaに対応)
- 7/27: vLLM v0.26.0 (411コミットの大型版) / Ollama v0.32.5 (NVFP4の品質バグ修正) / 論文「Memory for Large Language Models」
- 7/28: llama.cpp b10164 (Mamba-2のprefill高速化) / Audio8 TTS Preview 0.6B
- 7/29: llama.cpp b10175 (AMD RDNA世代別のMMQ調整基盤)
- 7/30: llama.cpp b10184 (MiMo V2.5のMTP層で投機的デコード)

今日から実利があるのはランタイム系の5件で、残りは様子見枠です。注意点はOllamaの更新順で、v0.32.4止めは量子化モデルの出力品質が落ちたままになります。

## 使い分け×エージェント連携×コスト

Claude CodeやCodexなどクラウドのコーディングエージェントが主戦場の人にも、今週の更新は関係します。OllamaはOpenAI互換API (接続先URLを差し替えるだけで使える共通方式) を持ち、ローカルホストへ向ければ定型処理の「下請け」構成が作れます。

- Claude Codeのhooks (決まったタイミングでコマンドを自動実行する仕組み) で、コミット時の差分要約だけローカルへ投げる。`git diff | ollama run <モデル名> "変更を1行で要約"` から試せます
- MCP (外部ツールとつなぐ共通規格) やカスタムツール経由で下請けモデルを登録する
- OpenHandsやclineは、接続先URLの切替だけでOllamaやvLLMへ移せます

役割分担は、機密コードの要約やテスト生成のような定型処理をローカル、設計判断をクラウド側に残す形です。コストの桁感は概算で、Mac既存機なら追加投資ゼロ+電気代、コーディング系サブスクは月20ドルクラス、GPU機の新調は数十万円クラスです。損益分岐は使い方に依存するため、まず下請け1本からが現実的です。

## Ollama v0.32.5: MacでLagunaを動かす

7月25日のv0.32.4で、Apple Silicon専用の機械学習フレームワークMLXを使うエンジンが新モデルLagunaに対応しました。リリースノートによると、M5 Maxで一部の射影処理が4〜9%速くなっています。

ただし今週最大の落とし穴がここです。v0.32.4のMLXには、Lagunaの配布形式であるNVFP4 (4ビット系の量子化形式) の出力品質を落とすバグがあり、2日後のv0.32.5で修正されました。更新するならv0.32.5まで一気に上げます。

```
ollama -v   # 0.32.5 以上を確認
ollama pull laguna-xs-2.1:nvfp4
ollama run laguna-xs-2.1:nvfp4 --verbose
```

Lagunaのパラメータ数は公式未公表のため、必要メモリはOllamaライブラリのサイズ表記で確認してください。

## llama.cpp: 高速化3連発 (MTP / Mamba-2 / AMD)

GGUFモデルを動かす本家のllama.cppには、性質の違う高速化が3本入りました。

一番大きいのは7月30日のb10184です。MiMo V2.5系で、モデル内蔵のMTP層を投機的デコードに使えるようになりました。投機的デコードは、下書き役が先にトークンを出して本体が検算する高速化で、MTPはその下書きをモデル自身が持つ仕組みです。外付けのドラフトモデルを選ぶ手間がなくなり、公式PRの検証ではMetal・CUDA両方で9〜12%の高速化です。

2本目は28日のb10164。CUDA環境のMamba-2でprefill (プロンプト読み込みの前処理) が並列化され、PRの測定では条件により約20%の短縮です。ただし速くなるのは初動だけで生成速度は変わらず、追加メモリとのトレードオフも指摘されています。

3本目のb10175は、AMD RDNA 3 / 3.5 / 4でカーネル設定を世代別に調整できる基盤です。改善と横ばいの条件が混在しており、様子見枠です。

いずれの数値も検証環境での値なので、手元ではllama-benchで更新前後のt/s (トークン毎秒) を比較するのが確実です。

## vLLM v0.26.0: 411コミットの大型版

GPUサーバーで高スループットを出す推論ランタイムのvLLMは、リリースノート記載で411コミット・212人参加の大型版です。目玉はThinking Machines Labの新型マルチモーダルモデルInklingへの一式対応で、基本推論に加えてLoRA (小さな差分だけを追加学習する手法)・投機的デコード・NVFP4量子化まで公開初日から揃っています。

ほかにDeepSeek-V4向け最適化、KVキャッシュ (過去トークンの計算結果の使い回し) 単位でAttention方式を選べる変更、出力ヘッドをfp32で扱う選択肢が入り、品質側にも手が入った印象です。基本的にLinux+GPU前提のため、Mac勢は前述のOllama章が本命です。

## 比較マトリクスと落とし穴5つ

|  | llama.cpp | Ollama | vLLM | MLX |
|---|---|---|---|---|
| 役割 | 汎用GGUF実行の土台 | 手軽なモデル管理 | GPUサーバー高スループット | Apple Silicon最適の基盤 |
| 今週の動き | 高速化3連発 | v0.32.4/.5でLaguna対応 | v0.26.0大型版 | Ollama経由で改善が波及 |
| ライセンス | MIT | MIT | Apache-2.0 | MIT |
| 対象環境 | Mac/GPU/CPU全般 | Mac/PC両対応 | Linux+GPU | Apple Silicon専用 |
| 刺さる層 | 量子化を突き詰める自作勢 | まず試したい人 | 業務オンプレ・自宅GPU | Macローカル勢 |

自宅GPUは1人用途ならllama.cpp、複数人やAPI互換で使い回すならvLLMが目安です。確認が必要なのはモデル側のライセンスです。

今週の落とし穴を5つにまとめます。

1. Ollamaの更新はv0.32.5まで一気に行う (v0.32.4止めは品質バグが残る)
2. 高速化の数値は各検証環境での値。手元では実測する
3. Mamba-2の高速化は初動のみで、生成速度は変わらない
4. AMD RDNAのMMQ調整は条件により横ばい・小幅低下もある
5. Docker / CIはランタイムのバージョンをタグ固定する

## 気づきツアー: 様子見の3件

- Audio8 TTS Preview 0.6B: 軽量なローカル音声合成のプレビュー版。対応言語とライセンスはモデルカード確認から
- 論文「Memory for Large Language Models」: LLMの記憶機構を体系整理したサーベイ。ローカルでエージェントを組むとき、文脈をどこへ貯めるかを考える語彙が揃います
- Mage-Flow: 公開数日でダウンロード4.4万件。中身の詳細はモデルカード確認待ち

## 今週の総括

チームに聞かれたら「ローカルLLMはコスト最適化の検証を始める時期」の1行です。ただし本番導入は、品質バグ修正へ追従できる体制が前提になります。実施リストは3つ。Ollamaをv0.32.5まで上げてLagunaを動かす、llama.cppのMTP対応をllama-benchで前後実測する、GPUサーバー勢はvLLM v0.26.0へ更新する、です。

動画内の読みとしては、3系統が同時に投機的デコードと量子化品質へ手を入れたのは、高速化の主戦場がそこへ移った合図だと見ています。MTP型の対応が8月中に他のモデルへ広がらなければ、この読みは外れです。

## 出典

- [Ollama v0.32.4](https://github.com/ollama/ollama/releases/tag/v0.32.4)
- [Ollama v0.32.5](https://github.com/ollama/ollama/releases/tag/v0.32.5)
- [Ollama MLXエンジン解説](https://ollama.com/blog/mlx)
- [Ollama OpenAI互換API](https://ollama.com/blog/openai-compatibility)
- [vLLM v0.26.0](https://github.com/vllm-project/vllm/releases/tag/v0.26.0)
- [Inkling 解説 (vLLM公式ブログ)](https://vllm.ai/blog/2026-07-15-inkling)
- [llama.cpp b10184 (MiMo MTP投機的デコード)](https://github.com/ggml-org/llama.cpp/releases/tag/b10184)
- [MiMo V2.5 MTP対応PR](https://github.com/ggml-org/llama.cpp/pull/26228)
- [llama.cpp b10164 (Mamba-2 prefill高速化)](https://github.com/ggml-org/llama.cpp/releases/tag/b10164)
- [llama.cpp b10175 (RDNA別MMQ調整)](https://github.com/ggml-org/llama.cpp/releases/tag/b10175)
- [Audio8 TTS Preview 0.6B](https://huggingface.co/Audio8/Audio8-TTS-Preview-0.6b)
- [論文 Memory for Large Language Models](https://huggingface.co/papers/2607.25380)
- [Mage-Flow (Comfy-Org)](https://huggingface.co/Comfy-Org/Mage-Flow)

## 詳細は動画で

各アップデートの画面と実行手順は、動画のほうで確認できます。

https://youtu.be/Soaxl15g-BM

チャンネルでは毎週、ローカルLLMやコーディングエージェントのまとめを公開しています。

