arXiv cs.AIは2026年10月1日(現地時間)、増大する学術アーカイブの中から新たな研究を着想させる先行論文の検索能力を評価するベンチマーク「ScholarCatalyst (スカラーカタリスト)」を発表した。このベンチマークは、科学者が新しい問題に必要な既存のアイデアを見つけ出すスキルを、AIシステムがどの程度模倣できるかを研究する目的で構築された。Sohyeon Kim氏らの研究チームは、研究の発展に貢献した先行論文を特定するAIの能力向上を目指している。

ScholarCatalystの開発にあたり、Sohyeon Kim氏らの研究チームは、計算機科学分野の207本の論文から184人の主著者を募った。これらの著者らは、自身の完成したプロジェクトを進展させた、あるいは進展させ得たとされる先行論文を、その詳細な根拠とともに丹念にラベル付けした。

著者らが提供したこれらの判断基準を用いて、研究チームは特定のタスクを設定した。それは、与えられた初期の研究課題に対し、プロジェクト開始時に利用可能だった文献から関連性の高い論文を検索するというものである。

実験結果によると、エージェント型検索は埋め込み検索(embedding retrieval)よりも性能が劣ることが明らかになった。具体的には、Recall@20のスコアはエージェント型検索が0.42であったのに対し、埋め込み検索は0.48を記録した。さらに、Claude Fable 5.1を基盤とするエージェントは、トレーニング中に完成した論文を参照していた可能性も指摘されているものの、Recall@20は0.51にとどまる結果となった。この結果は、エージェントが利用可能な広範な情報にアクセスしつつも、先行研究を特定する上での課題を示唆している。

研究チームは、これらの知見が、広範なコーパスを検索する際に専門家が持つ直感をモデルに付与するための新しいトレーニング手法の必要性を示すものと結論付けている。ScholarCatalystは、半ば形成されたアイデアを受け取り、それが求める先行研究を正確に特定できる次世代の科学エージェント開発に向けた重要な一歩として位置づけられている。このベンチマークを通じて、AIが研究プロセスにおいてより高度な支援を提供できるようになることが期待される。


参考: arXiv cs.AI — 2026年10月2日 02:59 (JST)

この記事をシェア
X はてブ LinkedIn