Ollama 0.35の判断モデルはMacで動く?Tev1 797MBの使い方と落とし穴5つ

· 木曜 ローカルLLM 週次 #ollama#localllm#llamacpp#mac#ai

この記事の要点

Ollama 0.35の判断モデルを整理。Tev1 0.8Bは797MBで振り分け、Clefは画像も判定。issue自動ラベルの組み方、費用の分かれ目、llama.cpp対応と落とし穴5つ。

Ollama 0.35 で入った「判断モデル」は、文章を書かず、選択肢ごとの確率だけを返すモデルです。 問い合わせの振り分けやモデルの使い分けを、手元の小さなモデルで回せます。 この記事は、2026年9月28日から10月2日に出たローカルLLM関連の動きを、判断モデルを軸にまとめたものです。

https://youtu.be/pJdf07SLMc0

今週の結論は3つ

さらに、llama.cpp も Ollama 0.35.0 の4日後に同じ窓口を追加しました。判断モデルは Ollama 専用ではなくなりつつあります。

今週出たもの(9/28〜10/2)

軸になるのは Ollama です。9月28日の v0.35.0 で判断モデル用の API ができ、翌29日の v0.35.1 で Clef と Clef Flash に対応しました。10月2日には llama.cpp が同じ窓口を追加しています。今週は判断モデルの週と考えて差し支えありません。

判断モデルとは何か

普通の LLM は文章を返します。判断モデルは、選択肢ごとの確率だけを返します。窓口のパスは /v1/systemone で、チャットとは別の API です。質問の型は choice(選ぶ型)、noul(当てはまる確率を返す型)、score(段階評価の型)の3種です。

リリースノートの例では、「朝9時から決済画面が 500 エラーになっている」という文を渡し、請求・不具合・アカウントの3択から選ばせています。返ってきたのは不具合が 0.9781 で、出力は1トークンだけです。文章を書かないので、返答の解析も要りません。

ここで注意したいのが、確率と確信度(confidence)が別の数字だという点です。例では確率 0.9781 に対し、確信度は 0.8906 でした。llama.cpp の server README では、確信度は 0〜1 の値で、0 は全選択肢が同じ確率という定義です。しきい値に使うのは、確率ではなく確信度のほうです。

Mac で動くのか:モデルとサイズ

掲載値(Ollama ライブラリ)で見ると、答えは「動くサイズ」です。

Tev1 のライセンス欄には、学習用スクリプトが MIT とあるだけで、重みの条件は未確認です。そのため分け方は、個人の非機密なら Tev1、業務なら Nimble になります。

量子化の種類や手元での速さ、常駐メモリは、ライブラリのページに書かれていません。動画の投稿者の Ollama は 0.35 未満で、1件あたりの秒数や20件の正答数は未計測です。

issue の自動ラベル付けに組み込む

最短の使い道が、issue のラベル付けです。新しい issue が立ったら本文を判断モデルに渡し、ラベルを1つ選ばせます。

GitHub が用意する実行環境からは手元の Ollama に届かないため、Ollama が動く Mac を self-hosted runner として登録して回します。ここで重要なのは、公開リポジトリでは使わないことです。GitHub Docs は self-hosted runner を非公開リポジトリで使うよう勧めています。公開すると、外部の人のプルリクエストから自分の Mac 上でコードが動く経路になるためです。

動画で示された流れは次のとおりです。

issue の本文は誰でも書ける入力です。誤った判定に誘導される前提で、人が確かめる設計にします。このワークフローの例は手元では未実行なので、非公開の試験用リポジトリで確かめてから使ってください。

費用の分かれ目

投稿者の概算では、前提は入力174トークン、出力5トークン(仮定)、Claude Haiku 4.5 の API 単価(入力100万トークン1ドル、出力5ドル)、1ドル150円、Mac の常時起動で+10W(仮定)、電気代31円/kWh です。

クラウドは1件あたり約0.0002ドルで、月1万件なら約2ドルです。ローカルは既存の Mac なら機材代0円で、電気代が月約220円です。分かれ目は月7,500件前後で、これより多ければローカルが得になります。ただ、効くのは金額よりも、文面を社外に出さないことだと整理されています。

Clef / Clef Flash と llama.cpp 対応

Cloudflare の Clef(27B)と Clef Flash(9B)は、既存モデルの上に選択肢を採点する小さな仕組みを載せた判断モデルです。ライセンスはどちらも Apache-2.0 で、Ollama のサイズは Clef が18GB、Clef Flash が11GB です。

使い方は、同じ /v1/systemone に画像を添えるだけです。リリースノートの例では、スクショに Ollama が写っているかを聞いて 0.958 が返っています。モデルカードには Clef Flash の中央値 38.8ms という数字がありますが、Cloudflare の自己申告で、動作確認の環境もデータセンター向けの H200 です。Mac での目安にはなりません。

llama.cpp は10月2日の版で /v1/systemone を追加し、続く版で Nimble と Clef に対応しました。ただし10月3日時点では、Clef は文字のみで、画像を送るとエラーになります。Tev1 は対応一覧にありません。画像まで見るなら、今は Ollama 0.35.1 以上を使う形です。

判断モデル4種の選び方

選ぶ軸は、メモリ、画像が要るか、使うランタイムの3点です。

掲載の正答率は、Tev1 が 4B で 73.3%、0.8B で 63.5%(Ollama 自社の評価)、Nimble が 75.7%(公開ベンチ13種)です。測定データが別々なので、横並びの比較はできません。

落とし穴5つ

  1. 文脈長の表示:一覧では 256K と出ても、Nimble は状態と質問の全部を 8,192 トークンに収める必要があり、Tev1 は入力約2,000トークンが目安です。長いログはエラー行の周りだけ渡します。
  2. 確率の過信:0.8B 版は3回に1回強外す水準です。20件は動作確認用で、しきい値を決めるなら数百件で測り直します。
  3. 認証のない公開:Ollama の API に認証の仕組みはなく、既定の待受は 127.0.0.1:11434 です。待受先を広げると同じネットワークの誰でも呼べます。
  4. 版の条件:Clef は Ollama 0.35.1 以上が必須です。また判断モデルは、チャット画面の候補に出てきません。
  5. llama.cpp の制限:Clef は文字のみで、載せたサーバーは判断専用(チャット不可)です。Tev1 は対応一覧にありません。

今後の見方

動画の投稿者の読みは、判断モデルがランタイムをまたぐ共通の窓口になる、というものです。外れる条件も示されており、1か月で LM Studio が /v1/systemone に対応しなければ外れとのことです。次回の動画で、LM Studio の対応と llama.cpp の Clef 画像入力を確認するとしています。

出典

詳細は動画で

送信例、GitHub Actions の設定、費用の計算過程は動画で順に見られます。毎週のローカルLLMの動きを追いたい方は、このチャンネルの更新を見に来てください。

https://youtu.be/pJdf07SLMc0