GitHubは10月5日(現地時間)、AIコードレビューエージェント向けのオープンベンチマーク「ReviewBench」を公開した。多数のGitHubプルリクエストに基づいて構築されたこのベンチマークは、コードレビューの品質を客観的に評価する。既存のベンチマークが抱える課題を解決し、実用的なAIコードレビューの進化を支援するため、本番環境での改善を予測するオフラインシグナルを提供する。これにより、測定された改善がユーザーにとって有益であることをより確実にできるようになる。
ReviewBenchは、多数のGitHubプルリクエストを分析し、言語、リポジトリサイズ、変更形状の分布をモデルとして構築されたものです。複数のプログラミング言語にわたる公開プルリクエストを含み、実際のコードレビューワークロードの多様性を反映しています。評価には、人間のレビュー担当者、大規模言語モデル (LLM)、静的解析ツールなど、複数の情報源から収集した知見を組み合わせた「マルチソース・ゴールデンセット」が使用され、これにより厳密かつ再現性のある評価が可能となります。
ReviewBenchは、既存のゴールデンセットのラベルのみを使用する精度と再現率のスコアに加え、ゴールデンセットにない新たな発見も評価する拡張された精度と再現率のスコアを含む、複数のメトリクスを提供します。これにより、レビューエージェントが未知の問題を発見した場合にも適切に評価されます。ユーザーは評価結果を絞り込んだり、精度と再現率の優先順位を設定したりするなど、好みに合わせた評価設定も可能です。
GitHubは、ReviewBenchの導入により、GitHub Copilotのオフライン評価が、本番環境での実験結果の方向性を予測する上でより効果的になったと述べています。これにより、測定された改善がユーザーにとって意味のある利益を反映しているという確信が高まりました。本ベンチマークは、公開前に独立した上級エンジニアによる検証を受け、高い一致率を達成しています。
参考: GitHub Blog (AI) (アーカイブ) — 2026年10月6日 00:59 (JST)