Scaleは2026年10月3日(現地時間)、AIエージェントのソフトウェアエンジニアリングタスク評価用ベンチマーク「SWE-Bench Pro」のリーダーボードを公開した。既存ベンチマークのデータ汚染やタスク多様性不足といった課題に対応するため開発され、現実世界の開発環境を反映した厳格な評価を提供する。この新ベンチマークでは、従来のSWE-Bench Verifiedで70%以上のスコアを記録した主要モデルが、約23%に留まるなど、AIモデルの性能に大きな差が生じている。非公開のプロプライエタリコードベースを含むプライベートサブセットでは、さらに解決率が低下することも明らかになった。

SWE-Bench Proは、AIエージェントのソフトウェアエンジニアリング能力を厳密かつ現実的に評価することを目的に開発された。従来のベンチマークが抱えていた、モデルが学習データで評価コードに接触している可能性による「データ汚染」、実際のソフトウェア課題を十分に捉えられない「限られたタスク多様性」、曖昧な問題が排除されることによる「過度に単純化された問題」、そして「信頼性と再現性に欠けるテスト」といった課題に対処する。

このベンチマークは、消費者向けアプリケーション、B2Bサービス、開発者ツールなど、多様で複雑なコードベースからタスクを抽出することでこれらの課題を解決する。データ汚染のリスクを軽減するため、公開サブセットにはGPLなどの強力なコピーレフトライセンスを持つオープンソースリポジトリが使用され、プライベートサブセットにはスタートアップパートナーからのプロプライエタリなコードベースが組み込まれている。

評価方法論は4段階で構成される。まず、選定された公開・非公開リポジトリから問題を「ソーシング」し、次にプロのエンジニアがDockerベースの再現可能な環境を「環境構築」する。その後、コミット履歴をスクレイピングしてバグ修正や機能追加、テストのfail-to-pass遷移、既存機能のpass-to-passテストを伴う問題が「ハーベスティング」される。最後に、人間の専門家が非構造化されたコミットやイシューメタデータを問題文と要件ブリーフに整理する「オーグメンテーション」を行う。Resolve Rateが主要評価指標となり、提出されたコードパッチが特定のバグ修正または機能実装と、既存機能への回帰がないことの両方を満たす場合にのみ「解決済み」とみなされる。

SWE-Bench Proデータセットは合計1865タスクを含み、41のプロフェッショナルリポジトリから構成される。このうち、公開セットは731インスタンスで公開リーダーボードで性能が追跡される。プライベートセットは18のスタートアップからの非公開プロプライエタリコードベースを含む276インスタンスで、別のリーダーボードで報告される。残りの858インスタンスはホールドアウトセットとして将来の分析と内部評価のために確保され、公開リーダーボードには掲載されない。

実際の評価では、OpenAI GPT-5が23.3%、Claude Opus 4.1が23.1%の解決率を記録し、SWE-Bench Verifiedでの70%超から大幅な性能低下が確認された。プライベートサブセットでは、Claude Opus 4.1が17.8%、OpenAI GPT-5が14.9%と、さらに解決率が低下した。また、OpenAI GPT-4o (4.9%) やQwen-3 32B (3.4%) などの旧モデルと比較して、OpenAI GPT-5やClaude Opus 4.1といった先端モデルの間には顕著な性能差が示された。モデルの性能はプログラミング言語によって異なることも判明している。


参考: labs.scale.com (アーカイブ) — 2026年10月4日 06:18 (JST)

原文ハイライト

"A major finding is the significant drop in performance for all models"

この記事をシェア
X はてブ LinkedIn