arXivが2026年10月7日(現地時間)付けで、AIエージェントが気候モデルを構築する能力を評価する新たなベンチマーク「SciExam for ENSO」に関する研究論文を発表した。この研究では、AIエージェントがエルニーニョ・南方振動(ENSO)の低次確率モデルを構築し、実際の観測データに基づきその性能を評価した結果、複数のエージェントが既存の公開モデルを上回るスコアを記録したことを報告している。

本研究で提案されたSciExam for ENSOは、AIエージェントが未知の答えを持つ科学研究を実行する際の評価指標として機能する。このベンチマークでは、エージェントは6時間以内に観測データを処理し、独自の診断を記述してこれをフィードバックとして利用しながらモデルを開発する。その後、隠れた評価者がモデルがENSOの統計を再現するか、観測されていない変数を回復するか、そして未公開の年の予測ができるかをテストし、公開されているモデルと同様の方法でスコアを付与する。

12のAIエージェントシステムを対象とした評価では、そのうち6つのシステムが公開モデルよりも高いスコアを達成した。これは主に、より優れた再構築能力と予測能力によるものとされている。さらに、性能の高いモデルの簡略化された形式は、ENSOの暖冷非対称性に関する二つの競合する説明のいずれかと互換性があることが示された。この非対称性は、本タスクで言及されていないにもかかわらず、現在も科学者間で議論が続いている未解決の問いである。

トップシステムの制御された実行により、その高いスコアが過去の観測記録の想起によるものではなく、受け取った情報がモデル構築の仕方を形成していることが示唆された。SciExam for ENSOは、このように答えが不明なエージェント研究を評価できる枠組みを提供し、AIエージェントが科学者が依然として議論している問題に関連する構造を持つ、競争力のあるモデルをすでに構築できる可能性を示している。

この研究はYinling Zhang、Langchen Liu、Dongbin Xiu、Xueyan Zou、Xu Kuang、Mengdi Wang、Shilong Liuの各氏によって執筆された。


参考: arXiv cs.AI (アーカイブ) — 2026年10月8日 02:52 (JST)

この記事をシェア
X はてブ LinkedIn