Sherpaは10月6日(現地時間)、大規模言語モデル(LLM)を教師として適応的に指導する新たなフレームワークとして発表された。このフレームワークは、多様な学習嗜好を持つ仮想のLLM学生アーキタイプをインスタンス化し、学生の学習成果を直接最大化することで、教師モデルの指導能力を最適化する。研究によると、この指導を受けた学生のパフォーマンスは平均で20.5パーセントポイント向上した。

大規模言語モデル(LLM)を教師として活用する取り組みが進む中、これまでの訓練アプローチはデモンストレーション、好みデータ、または事前定義された教育基準に依存しており、個々の学生の学習成果に基づくものではなかった。研究者らは、効果的な指導戦略が学習者によって大きく異なるという課題に対処するため、このマルチターン強化学習フレームワークを導入した。

「Sherpa」は、異なる学習スタイルを持つ仮想LLM学生の行動と反応をシミュレートする。これにより、教師LLMはこれらの学生を指導する過程で最適な教育戦略を学習することが可能となる。このアプローチは、教師LLMが学生の進捗を評価し、それに応じて指導内容や方法を調整するという、人間の教師が実践する適応型指導の原則を模倣している。具体的には、教師LLMは学生からの質問、訂正、および肯定的なフィードバックを考慮に入れ、複数の指導ターンにわたってその指導戦略を洗練させる。

このフレームワークで訓練されたLLM教師は、全アーキタイプの学生においてパフォーマンスを向上させた。MathTutorBenchを用いた評価では、Sherpaは教育学的スコアを52.5パーセントから79.2パーセントに引き上げ、指導の質の顕著な向上を示している。さらに、指導を受けた学生のパフォーマンスは平均で20.5パーセントポイント向上した。このモデルは、異なる知識レベルや学習嗜好を持つ学生に対して、個別化された指導を提供できるよう設計されている。

研究者らは人間を対象とした評価研究も実施した。その結果、訓練された教師モデルはベースモデルと比較して79.6パーセントのケースで、より好ましいと評価された。これは、Sherpaによって訓練されたAI教師が、人間の教育評価基準に対しても高い整合性を持つことを示唆している。

これらの結果は、SherpaがLLM教師を多様なシミュレーション学生に適応させ、最終的に人間の教師との整合性を高める上で有効であることを示している。本研究はWeixian Xu、Yanzhe Zhang、Zora Zhiruo Wang、Changyu Chen、Diyi Yangらが発表した。


参考: arXiv cs.AI — 2026年10月7日 02:58 (JST)

原文ハイライト

"Sherpa: Teaching LLMs to Teach Adaptively"

この記事をシェア
X はてブ LinkedIn