Scale、AIコード評価の新ベンチマーク「SWE-Bench Pro」リーダーボードを公開
Scaleは2026年10月3日(現地時間)、AIエージェントのソフトウェアエンジニアリングタスク評価用ベンチマーク「SWE-Bench Pro」のリーダーボードを公開した。既存ベンチマークのデータ汚染やタスク多様性不足といった課題に対応するため開発され、現実世界の開発環境を反映した厳格な評価を提供する。この新ベンチマークでは、従来のSWE-Bench Verifiedで70%以上のスコアを記録した主要モデルが、約23%に留まるなど、AIモデルの性能に大きな差が生じている。非公開のプロプライエタリコードベースを含むプライベートサブセットでは、さらに解決率が低下することも明らかになった。