arXiv cs.CLは10月1日(現地時間)、大規模言語モデル (LLM) エージェントが知識集約型タスクで外部ソースへの依存を深める中、既存手法では同一ソースの反復利用が漸進的な理解深化に繋がっていない現状を指摘する論文を公開した。研究者らはこの課題に対し、永続的で信頼できるソースから再利用可能なソース固有の能力を開発する「ソース学習」という概念を提唱。その能力構築・改良手法として「ソースラーン (SourceLearn)」を提案した。
この能力は、ソースの知識がどのように構造化され、解釈され、適用されるかを含む、再利用可能なソース固有の理解を捉える永続的なソースモデルとして表現されます。研究チームは、このようなモデルを構築し、漸進的に改良するための手法として、ソースラーン (SourceLearn) を提案しました。SourceLearnは、相補的な二つの学習メカニズムを組み合わせています。
一つは自己指向型ソース学習 (Self-Directed Source Learning) で、不完全に理解されている部分を特定し、適応的にソースを再訪します。もう一つはタスク誘導型ソース学習 (Task-Guided Source Learning) で、下流の経験を用いて局所的な表現のギャップや、ソース知識の編成における反復的なニーズを明らかにします。いずれのメカニズムにおいても、学習シグナルが何を見直すべきかを決定し、永続的な更新は信頼できるソースから再構築されます。
ルーチェン・フー氏 (Lucheng Fu) をはじめとする著者らは、5つのベンチマークと3つのLLMバックエンドでSourceLearnの性能を評価しました。その結果、15の設定のうち13で最高の性能を達成したと報告しています。特に、ハイブリッドRAG (Hybrid RAG) と比較して最大22.6ポイントの改善が見られ、静的なソース表現や経験ベースのメモリベースラインに対しても大幅な全体的改善が示されました。
参考: arXiv cs.CL (アーカイブ) — 2026年10月2日 02:50 (JST)
原文ハイライト"From Knowledge Access to Source Learning: Developing Source-Specific Competence"