arXiv cs.CLは10月1日(現地時間)、コーディングエージェントのコンテキスト管理を効率化する新手法「AutoCompact (オートコンパクト)」に関する論文を公開した。AutoCompactは、リポジトリレベルのソフトウェアエンジニアリングタスクにおいて、長期間にわたるコード検査、検索、編集、テストを通じて、エージェントがコンテキストを圧縮するタイミング、保持すべき状態、その後の継続方法をポリシーとして学習する。これにより、従来のコンテキストオーバーフロー回避に加え、陳腐化した探索情報の管理という課題に対応する。
コーディングエージェントは、リポジトリレベルのソフトウェアエンジニアリングタスクに取り組む際、コード検査、検索、編集、テストといった長期間の軌跡を経て解決に至る。タスクが進行するにつれて初期の探索情報は陳腐化するため、コンテキスト管理は単に情報のオーバーフローを避けるだけでなく、より戦略的な判断が求められる。エージェントは、いつコンテキストを圧縮するか、どの作業状態を保持するか、そしてその状態からどのように作業を継続するかを決定する必要がある。
AutoCompactは、これらの判断をポリシーの一部として行うようコーディングエージェントを訓練するアプローチを提案する。訓練データ収集のため、まず基本エージェントをコーディングタスクで実行する。その過程で、審査員がエージェントの圧縮決定、要約、および圧縮後のアクションをレビューする。欠陥のある出力は、環境で実行される前に修正済みのものに置き換えられ、各軌跡は修正された決定から継続される。これらの軌跡は教師ありファインチューニングに用いられ、その後、タスク成功報酬による強化学習を通じて、コーディングと圧縮の決定が共同で最適化される。
SWE-bench VerifiedおよびSWE-PolyBench Verifiedを用いた実験では、AutoCompactが基本モデルと比較して、それぞれ絶対値で9.2%および5.0%の合格率向上を示した。この改善は、評価された全ての推論予算において確認されている。特に、256Kのコンテキストウィンドウではオーバーフローが発生せず、16Kのウィンドウではオーバーフロー時にフォールバック圧縮がトリガーされた場合でもパフォーマンスが保持された。
参考: arXiv cs.CL (アーカイブ) — 2026年10月2日 02:54 (JST)
原文ハイライト"AutoCompact: Learning When to Compact Context in Long-Horizon Coding Agents"