Yilun Hao氏らは10月7日(現地時間)、大規模言語モデル (LLM) が多様な情報源から必要な証拠を効率的に導出するための新しいフレームワーク「RECAST」を開発したと発表した。同フレームワークは証拠構築を逐次的な意思決定プロセスとして扱い、フィルタリングや計算を通じて能動的に証拠を生成する。6つのベンチマークで平均成功率75.6%を達成し、既存の強力なモデルベースラインを15.9%上回る性能を示したという。

Yilun Hao氏ら複数の研究者が開発したRECAST (Routing Evidence through Computation, Access, and Synthesized Tools) は、大規模言語モデル (LLM) が長大で多様な情報源を扱うタスクにおいて、解決に必要な証拠を導出する能力の向上を目指すものです。

従来のRetrieval-Augmented Generation (RAG) システムは、固定的な類似性ベースの検索に依存しており、エージェント型のバリアントも依然として検索中心のアプローチを取っています。しかし、多くの複雑な推論タスクでは、単一の情報源から直接的に証拠が得られることは稀であり、複数の情報源にわたる綿密なフィルタリング、集約、あるいは計算が求められます。RECASTは、こうした課題への対応を企図しています。

RECASTは、証拠構築を多様な検索および計算操作にわたる逐次的な意思決定プロセスとして定式化することで、この課題に対処します。これにより、証拠が単に情報源から検索されるだけでなく、システムが能動的に情報を処理し、必要な証拠を導出する仕組みを構築しました。

RECASTは主に三つのコンポーネントで構成されています。

一つ目は「RouterLM」と呼ばれる軽量なモデルです。これは反復的にプリミティブな操作を選択・定式化するか、またはカスタマイズされた操作を特定する役割を担います。RouterLMによって指定された操作は、二つ目の「CompilerLM」に渡されます。CompilerLMはフリーズされたモデルであり、RouterLMからの指示を実行可能なコードに変換します。RouterLMは、導出された証拠がタスク解決に十分であると判断した場合、その証拠を三つ目の「AnswerLM」に渡します。AnswerLMもフリーズされたモデルで、最終的な解答を生成する役割を担います。RouterLMは、教師ありファインチューニング (SFT) と、その後のグループ相対ポリシー最適化 (GRPO) を用いて学習されました。

性能評価において、RECASTは6つの異なるベンチマーク群で平均成功率75.6%を記録しました。これは、最も強力な大規模モデルベースラインを15.9%上回る結果です。また、学習済みのQwen3.5-9B RouterLMは、学習なしのGemini 3.5 Flash RouterLMを5.0%上回る性能を示しました。さらに、評価に用いられなかった3つのホールドアウトベンチマークでは、最強のベースラインを平均で15.0%改善し、タスクや多様な情報源表現に対する高いゼロショット汎化性能を発揮しています。


参考: arXiv cs.AI (アーカイブ) — 2026年10月8日 02:51 (JST)

この記事をシェア
X はてブ LinkedIn