Jevとは?TypeSafeのSystem Oneモデル|リクエストとレスポンスの形、できないこと

· 土曜 AI業界 週間まとめ #jev#typesafe#systemone#llm#api

この記事の要点

2026年9月15日に早期アクセスとなった Jev は、文章を生成せずキーと確率だけを返すモデル。API の形、質問の3型、できないこと、数値の出どころを整理する。

問い合わせメールをどの部署に回すか。レビューがポリシー違反か。入力に脱獄 (制限を外す誘導) が混ざっていないか。こうした判定を LLM に投げている人は、返ってきた文字列を JSON として読み直し、壊れていたら再試行し、候補の外の値が来たらまた頼み直す、という後始末のコードを書いているはずです。欲しいのは値1個なのに、作文の全工程を通しているからです。

2026年9月15日に TypeSafe AI が早期アクセスで公開した Jev は、その文字列を返しません。返るのは選ばれたキーと、全候補の確率だけです。この記事では API の形、質問の3型、できないこと、数値の出どころを整理します。速度と料金の数値はすべて同社の評価で、独立した再現は執筆時点でありません。

https://youtu.be/CPnmlzRCv4I

Jev とは何か

作ったのは2年前創業の TypeSafe AI です。中心にいるのは OpenAI 出身の Diogo Almeida で、RLHF (人の評価でモデルを学習させる手法) の発明に関わった研究者だと TechCrunch が伝えています。

同社の主張はこうです。いまの大きなモデルは考える時間を伸ばす方向に進んでいて、それは遅い熟考 (System 2) の側にあたる。Jev は反対の速い直感を名乗り、System One モデルと呼ばれます。

いま判定に書いている後始末のコード

通常の LLM に分類させるコードは、だいたいこの形です。

res = llm.chat(f"どの部署? JSONで: {body}")
try:
    data = json.loads(res.text)           # 前置きが付くと落ちる
except json.JSONDecodeError:
    return retry(body)                    # 壊れたら、もう一度
if data["department"] not in DEPARTMENTS:
    return retry(body)                    # 候補の外なら、もう一度

7行のうち、モデルを呼ぶのは1行目だけです。残りは全部、返ってきた文章をデータに戻すための後始末です。再試行のたびに時間と料金が乗ります。

送るのは state と questions の2つだけ

宛先は POST /v1/systemone の1本です。送るのは判断材料の state と、名前を付けた質問の集まり questions だけです。

{
  "state": "請求金額が二重に引き落とされています。返金してください。",
  "questions": {
    "dept": {
      "type": "Choice",
      "instructions": "この問い合わせの担当部署を選ぶ",
      "criteria": {
        "billing": "請求・支払い・返金に関する問い合わせ",
        "tech": "不具合や操作方法に関する問い合わせ",
        "other": "上記以外"
      }
    }
  }
}

instructions が指示、criteria が選択肢のキーと説明の辞書で、255個まで並べられます。制約は次のとおりです。

返るのは choice と probabilities と confidence

{
  "dept": {
    "choice": "billing",
    "probabilities": { "billing": 0.91, "tech": 0.06, "other": 0.03 },
    "confidence": 0.91
  }
}

文章が無いので、パースする対象がありません。壊れた JSON も来ず、再試行も選択肢との突き合わせも消えます。

「幻覚しない」と紹介されますが、賢いから間違えないのではありません。候補をこちらが先に決めているので、外の値が出てこないだけです。候補の中での選び間違えは普通に起きます。probabilitiesconfidence を見て決めるのが使う側の仕事です。

質問の型は Choice / Score / Noul の3つ

Choice は候補から1つ選ぶ型で、上の例がこれです。Score は程度を測る型で、2〜10段を順番に並べます。並べた順が目盛りになり、返るのは段の間も含む位置です。Noul ははいかいいえの型で、書くのは指示だけです。

"severity": { "type": "Score", "instructions": "深刻さを測る",
              "criteria": ["軽微", "要対応", "重大"] }
--> "score": 1.035   // 軽微と要対応の間で、軽微寄り

"refund": { "type": "Noul", "instructions": "返金を求めているか" }
--> "noul": 0.97     // はいである確率。この型だけ confidence が無い

noul は数値そのものが確信度です。0.97 ならほぼはい、0.5 前後なら決めかねている、と読みます。分けたいなら Choice (部署、カテゴリ)、強さを測りたいなら Score (優先度、リスク)、条件に当てはまるかだけなら Noul です。3つは1つの questions に混ぜられ、部署と緊急度と暴言かを1往復で返せます。

置き換えられる判定

共通するのは、候補を事前に決められることです。

Jev にできないこと

Sentry の CTO、Armin Ronacher は「幻覚の問題を少しユーザーに押し付けている」と指摘しています。確率を見て決める責任が利用側へ移ったわけです。実務ではしきい値で分岐を組みます。戻せる操作は低めの確信度で通し、返金や送金は 0.85 超のときだけ自動で進め、0.5 未満は人に回す。しきい値は自分のデータで決めます。既定のモデル名は最新を指すため、本番ではバージョンを固定します。

速度と料金、測ったのは誰か

速度と料金はすべて TypeSafe 自身の内部評価で、比較ワークフローも同社の設計です。独立した再現はありません。

1判断あたり 単価 時間
Jev $0.0004 0.4秒
GPT-5.6 Terra $0.0304 10.1秒
GPT-5.6 Sol $0.0836 23.3秒
Claude Opus 5 $0.1761 37.8秒

割り戻すと単価の差は76倍・209倍・440倍、時間の差は25倍・58倍・94倍です (筆者の計算)。差の理由は、出力を作る工程が構造的に無いことです。入力は100万トークンあたり0.042ドル、出力は無料です。

ただし、単価を掛け算した見積もりは合いません。5000万行のレビュー判定で約20ドルという試算は、1行10トークン弱の前提です (筆者の検算)。自分のデータで計算し直してください。Vercel の5〜18倍も申告値です。桁が違うのは確かですが、測ったのは売り手側です。

まとめ

送るのは statequestions、返るのはキーと確率。置き換えられるのは候補が決まっている判定だけで、書く仕事と理由が要る仕事は今までどおりです。

ここからは筆者の読みです。半年以内に、AI 機能のうち分類・振り分け・点数付けだけを型つきモデルへ切り出す設計が定番になると見ています。独立した実測が出て精度が届かないと分かれば、この読みは外れます。

出典

しきい値の組み方は動画でも扱っています。

https://youtu.be/CPnmlzRCv4I