LLMハーネスの新評価枠組み、タスク特化とカバレッジ分離で推論改善を検証
Ziyang Xu氏らの研究チームは9月26日(現地時間)、arXiv cs.AIに論文を公開し、大規模言語モデル(LLM)ハーネスにおけるタスク特化と回答カバレッジを分離するための、新たな評価手法を導入したと発表した。この研究は、生成されたLLMハーネスがタスク特化を通じて推論能力を向上させる可能性を検証する。同時に、同一プログラムの繰り返し実行によるカバレッジの増加が、真のタスク特化の特定を困難にするという課題に対処している。