Claude CodeはPiの約2倍の費用?HarnessTaxとReal-SWEで見るハーネス比較

· 金曜 OSSエージェント 週次 #harness#claudecode#llm#cline#benchmark

この記事の要点

HarnessTaxの実測21組で、Claude Codeは最小ハーネスPiの約2倍の費用、成功率の差は1.1ポイントでした。Real-SWEの38.8%、Clineのリモート実行、乗り換え前の注意点をまとめます。

この記事は、2026年9月12日〜17日のOSS系コーディングエージェントの動きをまとめたものです。 中心は、ハーネスを変えると費用が約2倍動いた実測(HarnessTax)と、非公開の企業コードで最高38.8%だった新しいベンチ(Real-SWE)の2本です。 あわせて、ClineのSSHリモート実行と、乗り換える前に確認したい落とし穴4つを扱います。

https://youtu.be/On2MD4tX8QU

今週の地図

9月12日にReal-SWE、9月16日にHarnessTaxが公開され、ベンチマークが2本続けて出ました。9月17日にはリリースが重なっています。Clineのデスクトップ版(desktop-v0.0.31)と拡張側のv4.1.19、goose v1.51.0、OpenHands v1.20.0です。このほかにShow HNで新顔のツールが4本出ています。

ここでいうハーネスは、モデルに道具と文脈を渡す外側の仕組みのことです。今週はその違いが費用にどう出るかが数字で示されました。

HarnessTax: 成功率は同じで費用が約2倍

HarnessTaxはUC BerkeleyのSky LabとArenaのチームが公開した研究です。7つのモデルと3つのハーネス(Claude Code、Codex CLI、Pi)を組み合わせた21通りを測っています。Piは、読む・書く・直す・シェルの4つだけを持つ最小のOSSハーネスです。課題はSWE-bench LiteとTerminal-Bench 2.0で、それぞれ30問、各3回ずつ回して平均を取っています。

結果は次のとおりです。Claude Fable 5の成功率は、Claude Codeで97.8%、Codex CLIで96.7%、Piで96.7%でした。差は1.1ポイントです。一方、1回あたりの費用はClaude Codeが1.33ドル、Piが0.67ドルで、およそ2倍になります。

モデルをまたいだ幾何平均(倍率を掛け合わせて平均する出し方)では、SWE-bench LiteでClaude CodeはPiの約2.0倍、Codex CLIの1.6倍でした。Terminal-Bench 2.0ではPiの1.5倍で、2つのベンチで同じ向きに出ています。

なお、Pi基準に直したCodex CLIの約1.25倍は、2.0÷1.6で出した概算です。HarnessTaxの掲載値ではありません。

費用が膨らむ理由のひとつは、最初の一発目にあります。Claude Codeの初回コンテキストは、7モデル全部でPiの10倍を超えていました。指示文が長く、道具の定義も大きいためです。平均ターン数はほぼ同じで、Fable 5ではPiが15.4回、Claude Codeが15.3回でした。同じ回数動いて、費用だけが約2倍になっています。著者はこの差をハーネス税と呼んでいます。

読むときの注意が2点あります。

Real-SWE: 実務コードの到達点は38.8%

Specific Labsが出したReal-SWEは、実在企業から使用許諾を取った非公開の本番コードで測るベンチです。課題は請求や税の計算、顧客の移行など、止まると業務に響く種類の変更です。解決率はpass@1(1回きりの試行で通ったか)を、1課題あたり8回回して平均しています。

順位 組み合わせ 解決率 1回あたり費用
1 Fable 5.1 + Claude Code 38.8% 6.96ドル
2 GPT-6 Astra + Codex CLI 33.8% 4.67ドル
3 Grok 4.6 + Grok Build 32.5% 2.67ドル
4 Gemini 3.8 Flash + Gemini CLI 31.2% 2.50ドル

公開ベンチで9割を超える数字と比べると、まったく別の景色です。10課題のうち6課題は解決率が15%未満で、1課題は8モデル全部が8回中0回でした。

費用と解決率は比例していません。Gemini 3.8 Flashは2.50ドルで31.2%、首位のFable 5.1は6.96ドルで38.8%です。7.6ポイントの差に約2.8倍の費用がかかる計算です。

失敗したランを分類すると、最多は要件の見落としで、モデルごとに失敗の28.3%〜53.8%を占めました。次が確かめずに思い込みで進むパターンで、10.9%〜43.3%です。

ただし課題は非公開で、第三者が同じ条件で再現することはできません。公表値として扱うのが妥当です。

Cline: SSHリモート実行と並列サブエージェント

Clineのデスクトップ版(desktop-v0.0.31)がSSH越しのリモート実行に対応しました。アプリは手元のまま、エージェントのツール実行とファイル探索はホスト側で動き、承認と実行イベントだけが手元に返ります。設定はSettingsのRemoteでホストを登録し、環境セレクタで選びます。

鍵の扱いは慎重です。設定ファイルは ~/.cline/data/settings/remote-environments.json(mode 0600)で、記録するのは鍵ファイルのパスだけ、秘密鍵の中身は保存しません。ホスト鍵はSSHクライアント側で事前に信頼済みである必要があり、未知のものや変更されたものは拒否されます。

条件もあります。

同じ版でサブエージェントの並列実行も入りました。同じ手順を3件出した場合、合計ではなく最長の1件分で終わります。

goose・OpenHandsの変更と新顔ツール

goose v1.51.0では、CLIから計画モードとレシピ作成コマンドが削除されました。この2つを自動化スクリプトから呼んでいると、更新した時点で止まります。戻すならバージョンを固定し、上げるなら呼び出しを先に書き換えます。

OpenHands v1.20.0では、プロファイル単位で使える秘密情報とMCPサーバーを選べるようになりました。MCPはエージェントと外部ツールをつなぐ通信規格です。本番の鍵に触れるプロファイルを分けて配れますが、誰がどのプロファイルを使ったかの監査ログについては記載がありません。

Show HNの新顔は、Skillsync(セッションの持ち運び)、Ordewell(ゴールを順序付きタスクに分解)、Datamimic(テスト用の世界の勝手な生成を防ぐ)、Pizza Bot(背景実行向けの受信箱)の4本です。いずれも作者本人の説明で、第三者の検証結果はまだ出ていません。

4本の比較と乗り換え前の落とし穴4つ

Pi、Codex CLI、Claude Code、Clineを並べると次のようになります。

項目 Pi Codex CLI Claude Code Cline
費用(Pi=1) 1.0 約1.25(概算) 約2.0 計測対象外
モデル調達 BYOK 定額 or BYOK 定額 or BYOK BYOK
今週の変化 費用の最前線に Real-SWEで33.8% Real-SWEで38.8% SSHリモート実行

BYOKは自分のAPIキーを持ち込む方式です。Clineは、HarnessTaxとReal-SWEのどちらの対象にも入っていないため、費用欄は空にしています。

乗り換える前の落とし穴は4つです。

  1. 資産が引き継げない: 研究チームですらPiに、購読キー設定とターン制御の2パッケージを足しています。既存のスキル定義やMCP設定はそのまま移りません。
  2. 倍率は従量課金の話: 約2.0倍は2026年9月1日時点の直販API価格での比較です。定額利用なら枠の減り方として現れ、案件を従量に切り替えた時点で金額に出ます。
  3. ベンチの読み方: HarnessTaxは学習時に見ている可能性があり、Real-SWEは非公開で再現できません。どちらか片方だけでは決められません。
  4. 黙って消えるコマンドと監査ログ: gooseのCLIが例です。ClineのリモートもOpenHandsのプロファイル分離も、監査ログはリリースノートに記載がなく、必要なら自前で用意する前提です。

動画の予想として、次の2週間の主要ハーネスの更新は機能追加より費用の見える化(トークン内訳や上限設定)に寄る、と見ています。Claude Code、Codex CLI、Clineの3本のどれにも費用表示や上限の更新が出なければ、この読みは外れです。外れた場合は次回の金曜の回で報告します。

出典

詳しくは動画で

数字の出どころと前提は動画の概要欄にもまとめています。

https://youtu.be/On2MD4tX8QU