Edge0-35BはMacで動く?ピーク2.9GiBの仕組みとOllama 0.34の注意点

· 木曜 ローカルLLM 週次 #localllm#ollama#moe#applesilicon#gguf

この記事の要点

Edge0-35BがMac miniでピーク約2.9GiBで動く仕組み、Ollama 0.34.1と0.34.2の変更点、DeepSeek-V4.1-Flashの非対称activeを、実測の有無で整理します。

2026年9月8日から16日に出たローカルLLM関連の新モデルとランタイム更新を、「自分の手元で動かせるか」という一つの軸でまとめた記事です。 中心になるのは、35B級のMoE「Edge0-35B-A3B-preview」、Ollamaの0.34.1と0.34.2、DeepSeek-V4.1-Flashの3本です。

https://youtu.be/BlQ0JjIHA78

今週の対象と全体像

対象は9月8日から16日までの9日間に出た10本です。内訳は、新モデルが5本前後、量子化版が2本、Ollamaのリリースが2本、論文が数本という構成でした。並べてみると、今週の主役は新モデルそのものより「どう動かすか」の工夫だと分かります。

時系列で主なものを挙げると、次のとおりです。

なお、MoEは一部の専門家(エキスパート)だけを動かして速度を稼ぐ構造のことです。以降の話はこの前提で読んでください。

Edge0-35B: 35B級がMacでピーク約2.9GiB

普通は35Bのモデルなら、35B分の重みをすべてメモリに置きます。Edge0-35B-A3B-previewは、この前提を変えました。疎なMoEを丸ごと載せず、必要なエキスパートだけをそのつどSSDから読み込みます。

読み込み待ちで止まりそうに思えますが、prerouterという先読みの仕組みを入れ、待ち時間を隠す設計です。開発元の測定では、M4 Pro搭載のMac miniでピーク約2.9GiB、速度は約15〜18トークン毎秒でした。値はモデルカードに載っています。

代償として品質が落ちる

この構成は4ビット量子化と経路の変更を伴うため、品質は落ちます。落ちた分はRecovery LoRAという追加学習で補っていますが、5ベンチマーク平均は79.2で、FP16版より3.9ポイント低い値です。厳密な計算やコード生成に使うなら、同じ質問を量子化の前後で投げて自分で比べるのが早い方法です。

試せる環境と、確認できていない話

正式対応はApple Silicon搭載のMacだけです。WindowsやLinuxのGPUは、公開されている範囲では対応として示されていません。なお、ピーク2.9GiBからの単純な概算では、統合メモリ8GBのMacでも他のアプリを開いたまま入る計算になります。これは実測ではなく概算です。

話題になっている次の2点は、確認できていないため事実としては扱いません。

Ollama 0.34.1と0.34.2: 落とし穴は作る側

Ollamaは9月14日に0.34.1、15日に0.34.2を出しました。0.34.1が「作る側」、0.34.2が「入口」と、変えている場所が違います。

0.34.1: モデルを作る手順が変わった

MLXのsafetensorsからモデルを作る機能が、実験扱いを卒業しました。MLXはApple Silicon向けの機械学習フレームワークで、safetensorsは重みの格納形式です。

注意が必要なのはGGUFです。safetensorsからGGUFへ変換して量子化する場合、llama.cpp側のツールが必要になりました。ollama createだけで済ませていた手順は、そのままでは通りません。自前の変換スクリプトを持つ人や、CIでモデル作成を回している人は、上げる前にここを直してください。

もう一つ、モデル一覧APIのコールド応答が、公式テストで3.1秒から294ミリ秒になりました。

0.34.2: 初回起動とメモリの修正

0.34.2では、初回起動時にサインインするか、ローカルのまま使うかを選べるセットアップが加わりました。選択はmacOSとWindowsのデスクトップアプリで共有されます。

Apple Silicon向けには、MLXの投機的デコードでメモリが増え続ける問題の修正が入っています。投機的デコードは、小さいモデルに先に書かせて大きいモデルが答え合わせする高速化です。Macで長い生成を回して落ちていた人には、0.34.2まで上げる理由になります。

DeepSeek-V4.1-Flash: 非対称なactiveと置き場

DeepSeek-V4.1-Flashは552BのMoEです。特徴は、入力を読むときに動くのが8B、答えを作るときに動くのが16Bという非対称な作りにあります。activeとは、推論時に実際に動く重みの数のことです。

公式発表の値として、次の点が挙げられています。

ここで誤解しやすいのは「自分のマシンで動くのか」という点です。答えは、今のところ厳しいです。土台の552Bは減っておらず、activeが小さいのは速さの話であって置き場の話ではありません。

速度に関する報告(単一のRTX 5090と128GB RAMで毎秒5.1トークン、前の版より38%速い、公開後に品質が落ちた、など)はいずれも未確認で、事実としては扱いません。

MITライセンスで重みが配られている点は大きく、クラウドに出せないデータを扱う会社は自前のサーバに置けます。なお開発元は中国です。利用規約と出力言語の偏りは、各自で確認してください。

残りの新モデルと論文

いいねとダウンロード数は、2026年9月18日時点の収集値です。実際に引かれているのはQwen3.8-27Bの量子化版(Swift-Qwen3.8-27B-GGUF、ダウンロード7万2862件)でした。

4本を「手元で動くか」で並べる

モデル 総パラメータ 手元での実測 今日の判定
Edge0-35B 35B級 Mac miniでピーク2.9GiB Macなら試せる
DeepSeek V4.1 552B 報告のみ・未確認 サーバ側の話
Ternary-Bonsai-2 27B なし GGUF待ちで様子見
Xing4.0-29B 29B級 なし 情報待ちで様子見

パラメータが小さいことは、手元で動くことを意味しません。実測が出ているのはEdge0の1本だけで、これが今週の実情です。

今週の結論と外れる条件

今日そのまま試せるのは、MacでのEdge0と、Ollamaの0.34.2への更新です。0.34.1はGGUFの手順を直してから上げてください。DeepSeek-V4.1-Flashは、552Bを置ける機材があるかどうかが先です。

今週の地図は「重みを全部メモリに載せない方式が本命になってきた」です。ただし、2週間のうちにllama.cppかOllamaが同じ方式を取り込まなければ、この読みは外れです。外れた場合は、次の動画でそう伝えます。

Edge0の数値は開発元の測定値、Ollamaの数値は公式テストの値、DeepSeekの削減率は公式発表の値です。DeepSeekの速度報告や品質変化の声は、未確認のまま据え置いています。

出典

詳細は動画で

スライドと合わせて確認したい方は、動画をご覧ください。このチャンネルでは、ローカルLLMの更新を毎週まとめています。

https://youtu.be/BlQ0JjIHA78