Qijia He (チジア・ヘー)氏らは7月21日(現地時間)、コーディングエージェントの失敗回復において、予算に応じて安価なモデルと高価なモデルを使い分けるルーティング手法「CodeRescue (コードレスキュー)」を発表した。この手法は、展開時のコストペナルティを再訓練なしで選択するコンフォーマル・リスク・コントロール (Conformal Risk Control、CRC) レイヤーを導入。GPT-5.4-nano/GPT-5.4の設定で既存手法を改善し、平均回復コストの35%で解決率を上回る実績を示した。

コーディングエージェントは、失敗した試行が単なる誤った回答ではなく、実行可能なフィードバックを生み出す実行環境での動作が増加している。

既存のコスト認識型システムは、このような失敗をカスケード決定として扱うのが一般的であり、まず安価なモデルを試行し、困難なケースをより強力で高価なモデルにエスカレートさせる。しかし、コーディングにおいては、実行フィードバックが安価なモデルによるさらなる回復を価値あるものにする可能性があり、予算に応じた展開に関する課題が提起されていた。

Qijia He氏らは、この失敗後の決定を異種アクション間の回復ルーティングとして定式化し、実行ロールアウトから教師ありルーターを訓練した。

予算の変動下でも同じルーターを使用可能にするため、本研究ではコンフォーマル・リスク・コントロール (CRC) レイヤーを追加した。このCRCレイヤーは、再訓練なしで展開時コストペナルティを選択し、交換可能性の下での期待コストの限界制御を提供する。5つのコーディングベンチマークの保留された失敗全体で、安価な回復とエスカレーションは相補的な成功パターンを示した。

キャリブレーションされたフロンティアは、固定アクション、プロンプトのみのルーター、およびバイナリカスケードのベースラインよりも改善された。主要なGPT-5.4-nano/GPT-5.4設定では、CRCキャリブレーションされたフロンティアポイントの一つが、常にエスカレートする解決率を上回りながら、その平均回復コストの35%を使用している。関連コードはGitHubで公開されている。


参考: arXiv cs.AI (アーカイブ) — 2026年7月22日 02:56 (JST)

原文ハイライト

"Budget-Calibrated Recovery Routing for Coding Agents"

この記事をシェア
X はてブ LinkedIn