同じClaude Opus 5でもハーネス次第で成績が30から100に変わった週
この記事の要点
NVIDIAのAVOが同じOpus 5のままARC-AGI-3を30から100に。Hermes Agentの919変更とOpenCodeの272,000上限もまとめました。
再生できない場合は YouTube で見る · チャンネル登録
OSS・セルフホスト系のコーディングエージェントの週次まとめです。対象期間は2026年8月16日から21日で、Claude Code本体やCodex本体の更新はなく、周辺ツール群の動きが中心でした。同じClaude Opus 5のまま成績が30から100に変わった実験、Hermes Agentの1週間4リリース、OpenCodeの文脈上限の揃え直しを軸に、動画を見ていない方にも要点が追える形にまとめます。
8月16日から21日に何が動いたか
起点は8月16日のHermes Agent v0.20.2です。以降17・18・21日と同じツールがリリースを重ねました。17日にOpenHands v1.14.0、19日にエディタHuzzahがHacker Newsの上位に入り、20日にOpenCode v1.18.19、同じ20日にHacker Newsへ自作ハーネス4本が並びます。21日は今回扱うツールが5本まとめて出た日で、Hermes・OpenCode・Goose・Cline・OpenHandsが同日更新。同じ21日、NVIDIAがAVOを公開しています。今週いちばん大きい話はここです。
同じモデルのまま成績が30から100になった実験
NVIDIAが8月21日に公開したAVOは、汎用のコーディングエージェント基盤です。前提として、これは研究プロジェクトであり製品ではなく、明日インストールして使えるものではありません。
評価に使ったARC-AGI-3は、説明のない2Dゲームを手探りで攻略させ、長い手順をこなせるかを測るベンチマークです。AVOは公開セットの183レベルを全クリアしRHAEスコア100.00を記録しました。同じ課題をClaude Opus 5単体で解かせたベースラインは30です。既存手法のVISTAより環境への操作回数も12%少なく済んでいます。
モデルを変えずに何を足したのか。1つは文脈把握・計画・実装・評価を担うメインエージェントで、永続メモリとツール実行を持ちます。もう1つはsupervisor、監督役です。進捗が止まったら外から割り込んで立て直します。差がついたのはモデルの性能ではなく、周りをどう作るかという設計の側でした。
持ち帰るとすれば3点です。セッションをまたいで残る記憶があるか、進捗停滞を検知して割り込めるか、結果を自分で評価して作り直すループが回っているか。Claude CodeのhooksでPostToolUseを使えば停滞検知に近いことができ、Agent SDKのセッション管理で永続メモリの一部は自前で組めます。supervisorのような外部監督役は標準機能だけでは組めず自作が必要です。
一方で読み方には注意が必要です。100という数字は公開セットの値で、非公開セットの成績もコードの公開範囲も分かりません。TechCrunchの8月21日の報道では、Nvidiaの副社長がエージェントをモデル・ハーネス・ランタイム・スキルの集まりだと説明し、OpenAIやDatabricksも同様の調整で成績や費用を改善したと伝えていますが、一次情報は伝聞です。モデル単体の比較表だけで判断するのはもう十分ではなさそうです。
Hermes Agentが1週間に4回、合計919の変更
Hermes Agentは定期実行に強いCLI・デスクトップ型のエージェントです。8/16・17・18・21と4回リリースし、各リリースノートの変更数(397・125・74・323)を足すと合計919本になります。
内訳を見ると、16日は複数のゲートウェイをまとめるConnectionsレジストリとMCPの死活監視、17日は定期ジョブの自動復旧とworktree・巻き戻し機能でした。21日公開のv0.20.5では、APIキー不要のWeb検索、停止検知、定期ジョブの永続メモリが追加され、永続メモリと停止検知はAVOで効いていた2要素と重なります。
更新前には、今動いている定期ジョブの一覧を控えておくのが安全です。919本の個別の変更点の完全な解説は次のv0.21.0で公開予定とされており、今の一次資料はリリースノートの箇条書きにとどまります。8月18日のv0.20.4ではmacOSデスクトップ版が更新後に起動しない報告も1件出ており、再起動で回避できると記載されています。
OpenCodeが文脈上限をCodex本体と同じ272,000に
OpenCodeはターミナルで動くエージェントで、8月20〜21日にv1.18.19からv1.18.21まで3回リリースされました。v1.18.19ではCloudflare AI Gatewayのモデルを2つのAPI形式で通せるようになり、ChatGPT契約経由のCodex OAuthを使う際のGPT-5.6系の文脈上限を272,000に揃えています。この数値はCodex本体と同じ値で、ずれると超過後に文脈を切り詰める処理が間に合わなくなります。
v1.18.20では、サブエージェント失敗時に再開用のtask_idを返すようになり、通信の一時切断への再試行も入りました。v1.18.21では、モデルが未知の終了理由を返すと処理が止まる問題の修正とVertex AIのリージョン指定対応が入っています。共通するのは「落ちても戻れる」方向です。既存のChatGPT契約をそのままOSSのCLIから使える点は、ライセンスを増やさず検証を始められる利点になります。
Goose・Cline・OpenHands、そして自作ハーネス4本
残り8件は名前と1行で紹介します。Gooseはv1.47.0で、動的クライアント登録に非対応の企業ID基盤MCPを事前登録OAuthで接続できるようになりました。Clineはv4.1.11で対応モデルがタスク中に画像を生成して会話に表示でき、v4.1.12では企業が許可したMCPサーバーだけを設定画面に出す制御が入りました。OpenHandsはv1.14.0とv1.15.0で、エラー種別の表示やローカルLLMの接続設定を追加しています。企業ID基盤やMCPポリシーへの対応はClaude CodeやCodexの標準機能にまだ無く、この3本が先行しています。
新顔では、擬似コードを意図の記録として扱う実験的エディタHuzzahがHacker Newsで373ポイントを集めました。作者自身が大規模開発との相性には課題があると明記しています。同じ週にはfx(311)・Munder Difflin(167)・OneCLI(87)・Seed(55)という自作ハーネス4本も並び、合計620ポイントです(各値はHacker News掲載時点、リンクは出典参照)。最小構成のハーネスを自分で書く動きが個人スケールでも出ています。
4ツールを同じ物差しで並べると
今週動いた4ツールを比べると、機能追加より「落ちても止まらない・戻れる」に寄っています。
| ツール | 今週のリリース数 | 今週入った軸 | 落ちても戻れるか |
|---|---|---|---|
| Hermes Agent | 4本 / 919変更 | 常時運用の復旧 | cron自動復旧+停止検知 |
| OpenCode | 3本 | 経路と再開 | task_idで再開 |
| Goose | 1本 | 企業ID基盤対応 | 長時間切断への対策 |
| OpenHands | 2本 | 導入・運用体験 | 記載なし |
落ちても戻れる仕組みは4本中3本に入り、OpenHandsだけ該当の記載がありません。4本とも自分の契約を通すため、席あたりの固定費が増えません。ただしOpenCodeのように経路がBYOK・Cloudflare AI Gateway・Codex OAuth・Vertex AIへ分かれると、費用の出どころも分散しやすくなります(運営者の見立てで、公式の注意書きではありません)。
今週の落とし穴4つ
1つ目は乗り換えの手間です。919変更は個別の解説がまだ揃っておらず、自分で確かめる前提になります。2つ目は費用の見えにくさで、OpenCodeのように経路が複数に分かれると月末の合算まで気づけない形になりやすいです。3つ目は更新直後の不具合で、Hermes Agent v0.20.4のmacOSデスクトップ起動不能の報告が該当します。4つ目はベンチマークの読み方で、AVOのRHAE 100.00は公開セットの値であり、非公開セットの成績や製品化の見通しは分かりません。
出典
- NVIDIA公式ブログ (AVO / ARC-AGI-3)
- TechCrunch (8/21、ハーネスが主役という報道)
- Hermes Agent v0.20.2〜v0.20.5 の各リリースノート
- OpenCode v1.18.19
- Goose v1.47.0
- Cline v4.1.11
- OpenHands v1.15.0
- Huzzah (作者ブログ)
- fx
- Munder Difflin
- OneCLI
- Seed
タイムラインの詳細やツール別の比較図は動画で紹介しています。