小規模言語モデル、エージェントハーネスでの適格性ギャップが明らかに
arXiv cs.AIは2026年10月1日(現地時間)、Jundong Hu氏とShekar Ramachandran氏らの研究論文を公開した。大規模言語モデル(LLM)のプランナーを補完するマイクロタスクにおいて、市販の小規模言語モデル(SLM)が実務家定義の閾値を満たさない「適格性ギャップ」が存在すると報告している。Qwen3やLlama-3.xモデルを用いた評価では、テストされた全ての構成で合格に至らなかった。
Tag
1 件の関連記事