SWE-agentは2026年9月27日(現地時間)、GitHubリポジトリを更新し、新しいベンチマーク「CodeClash」と100行のAIエージェント「mini」に関する情報を公開した。CodeClashは、ソフトウェアエンジニアリングエージェントの評価をタスクではなく目標に基づいて行う。一方、miniはSWE-bench verifiedで65%のスコアを達成したとされている。

SWE-agentは、プリンストン大学 (Princeton University) とスタンフォード大学 (Stanford University) の研究者によって構築・維持されている。このシステムは、選択したLM (Language Model) エージェントを使用してGitHubのイシューを自動的に修正することを目的としている。攻撃的サイバーセキュリティや競技プログラミングへの応用も可能である。

新たに導入されたCodeClashベンチマークは、ソフトウェアエンジニアリングエージェントをタスクの完了ではなく、より広範な「目標」に基づいて評価する。SWE-benchは、AIシステムを実際の世界のGitHubイシューで評価するための既存のベンチマークとして機能する。

100行のAIエージェントであるmini-SWE-agentは、シンプルさを特徴とし、GitHubイシューの解決やコマンドラインでの支援に使用できる。同エージェントはSWE-bench verifiedで74%以上のスコアを記録したとされている。関連プロジェクトには、AIエージェント向けのサンドボックスコード実行基盤であるSWE-ReXや、SWEトレーニングデータを大規模に生成するためのSWE-smith、クラウドでの評価実行のためのsb-cliなどが含まれる。


参考: github.com — 2026年9月28日 09:00 (JST)

原文ハイライト

"New benchmark: CodeClash ( website , github ) evaluates SWE agents on goals, not tasks"

この記事をシェア
X はてブ LinkedIn