Ziyang Xu氏らの研究チームは9月26日(現地時間)、arXiv cs.AIに論文を公開し、大規模言語モデル(LLM)ハーネスにおけるタスク特化と回答カバレッジを分離するための、新たな評価手法を導入したと発表した。この研究は、生成されたLLMハーネスがタスク特化を通じて推論能力を向上させる可能性を検証する。同時に、同一プログラムの繰り返し実行によるカバレッジの増加が、真のタスク特化の特定を困難にするという課題に対処している。

Ziyang Xu氏らの研究チームは、LLMハーネスの評価において、回答カバレッジ、再現可能なタスクの優位性、および事前実行選択による利益を明確に分離することを目的として、新しい評価枠組みを提案した。この枠組みは、ハーネスの性能をより精密に分析し、その真の特化能力を識別することを目指している。

実験では、MATH-500データセットから抽出された386のタスクを使用し、8つの生成されたハーネスと1つのベースラインハーネスを評価した。比較のため、9つのバイト単位で同一なベースラインコピーも用意され、各メンバーに対して3回の実行が実施された。この結果、同一プログラムの繰り返し実行が、平均で2.16パーセントポイントのオラクルヘッドルームを生み出すことが示された。

分析の結果、生成されたプログラムはベースラインと比較して大幅に再現性の高いスコアパターンを示したものの、これは主にハーネスが持つ持続的な弱点を浮き彫りにするものであった。具体的には、ベースラインに対する損失は、100のタスクすべてにおいて、3回の繰り返し実行全体を通じて持続的に観察された。一方で、持続的な勝利はわずか1タスクでのみ発生し、その結果は回答抽出プロセスに影響された可能性が指摘されている。フリーズされたセレクターは0.00パーセントポイントの利益を示し、両集団は27回のハーネス実行で98.70%のオラクルカバレッジに達した。しかし、安定した相補性は3回の繰り返し実行では解決されなかった。

BIRDトレースを用いた詳細な分析では、ハーネスにおけるメカニズムの実装、アクティベーション、および出力の有効性における失敗が特定された。これらの発見に基づき、研究チームは、カバレッジと再現性だけでは、有用な特化の主張を正当化することはできないと結論付けている。研究は、ハーネスの多様性を評価する基準として、タスクの優位性が実行全体を通じて持続し、利用可能な決定を導き、さらに一致した推論予算の下で追加の固定プログラム実行によって改善されるべきであると提言している。


参考: arXiv cs.AI (アーカイブ) — 2026年9月30日 13:00 (JST)

原文ハイライト

"separating coverage from specialization in LLM harnesses"

この記事をシェア
X はてブ LinkedIn