arXiv cs.AIは2026年9月24日(現地時間)、AIシステムが未知の環境で新たな知識を探索・獲得する能力を評価するための新たなベンチマーク「ExplorationBench」を発表した。このベンチマークは、ルールが実行可能で既知の知識では解決できない「検証可能なエイリアン・ワールド (Verifiable Alien Worlds)」という独自の枠組みを採用しており、AIが仮説形成や実験設計、結果の反復を通じて真に新しい発見を検証できるかどうかに焦点を当てている。
この研究は、科学的発見が既知の問題の範囲を超えたところで始まるという前提に基づき、AIシステムが探索(exploration)に従事する必要性を指摘している。従来の評価では、本当に新しい仮説が成立するか、またシステムが探索によって発見したのか、それとも事前学習データからの知識を想起しただけなのかを検証することが困難であった。ExplorationBenchは、これらの課題を解決するため、具体的な評価フレームワークを提供している。
ExplorationBenchは、「Alien Worlds」と呼ばれる検証可能な環境で構築されており、そのルールは実行可能であるため、すべての回答を正確にチェックできる。また、これらのルールは一般的な知識と矛盾するため、単なる知識の想起(recall)ではタスクを解決できないよう設計されている。
ベンチマークは「AlienCode」と「AlienLogic」の2つのサンドボックスで構成される。AlienCodeは31の発見ターゲットと70のタスクを、AlienLogicは24の発見ターゲットと70のタスクを含む。各サンドボックスには、不完全なマニュアル、タスク固有の環境フィードバック、および専用のツールコールスキーマが提供される。システムはこれらのリソースを使用してサンドボックス内を探索し、その後、隠されたタスクを解決する仕組みである。
著者らは、10のAIシステムを評価した。その結果、最も強力なシステムは馴染みのないルールを習得し適用できることが示された一方、パフォーマンスは探索の経路によって大きく変動し、継続的な探索が以前の成果を停滞させたり逆転させたりする場合があることも判明した。ExplorationBenchは、未知の環境での探索を通じて真に新しい知識を獲得・適用できるAIシステムの実現に向けた一歩であると位置づけられている。
参考: arXiv cs.AI (アーカイブ) — 2026年9月25日 02:37 (JST)
原文ハイライト"AI systems must engage in exploration: framing hypotheses, designing experiments, and iterating on the results."