MacでLagunaが動く: Ollama・llama.cpp・vLLM同時更新の要点と落とし穴5つ

· 木曜 ローカルLLM 週次 #localllm#ollama#llamacpp#vllm#ai

この記事の要点

2026年7月24〜30日のローカルLLM動向まとめ。OllamaのMac向けLaguna対応、llama.cppの投機的デコード、vLLM v0.26.0の要点と、更新時に踏みやすい落とし穴5つを整理します。

2026年7月24日から30日のローカルLLM関連の動きをまとめた記事です。今週は新モデルよりも、モデルを動かすランタイム側が主役でした。Ollama・llama.cpp・vLLMの3系統が同時に高速化と品質修正を進めており、更新する理由がはっきりある1週間です。

https://youtu.be/Soaxl15g-BM

今週の全体像 (7/24-7/30)

取り上げたのは9件です。

今日から実利があるのはランタイム系の5件で、残りは様子見枠です。注意点はOllamaの更新順で、v0.32.4止めは量子化モデルの出力品質が落ちたままになります。

使い分け×エージェント連携×コスト

Claude CodeやCodexなどクラウドのコーディングエージェントが主戦場の人にも、今週の更新は関係します。OllamaはOpenAI互換API (接続先URLを差し替えるだけで使える共通方式) を持ち、ローカルホストへ向ければ定型処理の「下請け」構成が作れます。

役割分担は、機密コードの要約やテスト生成のような定型処理をローカル、設計判断をクラウド側に残す形です。コストの桁感は概算で、Mac既存機なら追加投資ゼロ+電気代、コーディング系サブスクは月20ドルクラス、GPU機の新調は数十万円クラスです。損益分岐は使い方に依存するため、まず下請け1本からが現実的です。

Ollama v0.32.5: MacでLagunaを動かす

7月25日のv0.32.4で、Apple Silicon専用の機械学習フレームワークMLXを使うエンジンが新モデルLagunaに対応しました。リリースノートによると、M5 Maxで一部の射影処理が4〜9%速くなっています。

ただし今週最大の落とし穴がここです。v0.32.4のMLXには、Lagunaの配布形式であるNVFP4 (4ビット系の量子化形式) の出力品質を落とすバグがあり、2日後のv0.32.5で修正されました。更新するならv0.32.5まで一気に上げます。

ollama -v   # 0.32.5 以上を確認
ollama pull laguna-xs-2.1:nvfp4
ollama run laguna-xs-2.1:nvfp4 --verbose

Lagunaのパラメータ数は公式未公表のため、必要メモリはOllamaライブラリのサイズ表記で確認してください。

llama.cpp: 高速化3連発 (MTP / Mamba-2 / AMD)

GGUFモデルを動かす本家のllama.cppには、性質の違う高速化が3本入りました。

一番大きいのは7月30日のb10184です。MiMo V2.5系で、モデル内蔵のMTP層を投機的デコードに使えるようになりました。投機的デコードは、下書き役が先にトークンを出して本体が検算する高速化で、MTPはその下書きをモデル自身が持つ仕組みです。外付けのドラフトモデルを選ぶ手間がなくなり、公式PRの検証ではMetal・CUDA両方で9〜12%の高速化です。

2本目は28日のb10164。CUDA環境のMamba-2でprefill (プロンプト読み込みの前処理) が並列化され、PRの測定では条件により約20%の短縮です。ただし速くなるのは初動だけで生成速度は変わらず、追加メモリとのトレードオフも指摘されています。

3本目のb10175は、AMD RDNA 3 / 3.5 / 4でカーネル設定を世代別に調整できる基盤です。改善と横ばいの条件が混在しており、様子見枠です。

いずれの数値も検証環境での値なので、手元ではllama-benchで更新前後のt/s (トークン毎秒) を比較するのが確実です。

vLLM v0.26.0: 411コミットの大型版

GPUサーバーで高スループットを出す推論ランタイムのvLLMは、リリースノート記載で411コミット・212人参加の大型版です。目玉はThinking Machines Labの新型マルチモーダルモデルInklingへの一式対応で、基本推論に加えてLoRA (小さな差分だけを追加学習する手法)・投機的デコード・NVFP4量子化まで公開初日から揃っています。

ほかにDeepSeek-V4向け最適化、KVキャッシュ (過去トークンの計算結果の使い回し) 単位でAttention方式を選べる変更、出力ヘッドをfp32で扱う選択肢が入り、品質側にも手が入った印象です。基本的にLinux+GPU前提のため、Mac勢は前述のOllama章が本命です。

比較マトリクスと落とし穴5つ

llama.cpp Ollama vLLM MLX
役割 汎用GGUF実行の土台 手軽なモデル管理 GPUサーバー高スループット Apple Silicon最適の基盤
今週の動き 高速化3連発 v0.32.4/.5でLaguna対応 v0.26.0大型版 Ollama経由で改善が波及
ライセンス MIT MIT Apache-2.0 MIT
対象環境 Mac/GPU/CPU全般 Mac/PC両対応 Linux+GPU Apple Silicon専用
刺さる層 量子化を突き詰める自作勢 まず試したい人 業務オンプレ・自宅GPU Macローカル勢

自宅GPUは1人用途ならllama.cpp、複数人やAPI互換で使い回すならvLLMが目安です。確認が必要なのはモデル側のライセンスです。

今週の落とし穴を5つにまとめます。

  1. Ollamaの更新はv0.32.5まで一気に行う (v0.32.4止めは品質バグが残る)
  2. 高速化の数値は各検証環境での値。手元では実測する
  3. Mamba-2の高速化は初動のみで、生成速度は変わらない
  4. AMD RDNAのMMQ調整は条件により横ばい・小幅低下もある
  5. Docker / CIはランタイムのバージョンをタグ固定する

気づきツアー: 様子見の3件

今週の総括

チームに聞かれたら「ローカルLLMはコスト最適化の検証を始める時期」の1行です。ただし本番導入は、品質バグ修正へ追従できる体制が前提になります。実施リストは3つ。Ollamaをv0.32.5まで上げてLagunaを動かす、llama.cppのMTP対応をllama-benchで前後実測する、GPUサーバー勢はvLLM v0.26.0へ更新する、です。

動画内の読みとしては、3系統が同時に投機的デコードと量子化品質へ手を入れたのは、高速化の主戦場がそこへ移った合図だと見ています。MTP型の対応が8月中に他のモデルへ広がらなければ、この読みは外れです。

出典

詳細は動画で

各アップデートの画面と実行手順は、動画のほうで確認できます。

https://youtu.be/Soaxl15g-BM

チャンネルでは毎週、ローカルLLMやコーディングエージェントのまとめを公開しています。