arXiv cs.AIは2026年10月1日(現地時間)、Jundong Hu氏とShekar Ramachandran氏らの研究論文を公開した。大規模言語モデル(LLM)のプランナーを補完するマイクロタスクにおいて、市販の小規模言語モデル(SLM)が実務家定義の閾値を満たさない「適格性ギャップ」が存在すると報告している。Qwen3やLlama-3.xモデルを用いた評価では、テストされた全ての構成で合格に至らなかった。
研究は、シェルコマンドの自動承認、メモリ書き込み、ツール選択、過去のターンランキングといったエージェントハーネスにおけるマイクロタスクでSLMが有効か否かを検証した。4種類のマイクロタスクベンチマークを構築し、固定プロンプトと自動メトリクスを用いて、安価な非LLMベースラインに設定された閾値τに対するSLMの性能を評価した。
Qwen3 0.6B、1.7B、4B、8BモデルをFP16、貪欲デコーディング、固定プロンプト、チューニングなしの条件で評価した結果、16の構成(4タスク×4モデル)全てが閾値をクリアできなかった。この「適格性ギャップ」は、生の出力とパーサーの動作を検証することで確認された。
失敗の分析では、ログ確率に基づく決定閾値診断を通じて、原因が「能力不足」とデコーディング閾値の変更で対処可能な失敗の2種類に分類された。また、4ビット量子化(RTN/GPTQ/AWQ)もモデルサイズに応じた性能低下を引き起こし、いずれの構成も適格性をもたらさなかった。このギャップはモデルサイズに強く相関し、精度にはそれほど依存しないことが示唆されている。Llama-3.xモデル(12構成中12構成が不適格)でも同様の傾向が再現された。
この研究は、SLMをCIに裏打ちされた閾値を満たすベースラインの後ろに配置し、ベースラインが閾値を満たせない状況でのみSLMを利用するという実用的な示唆を提供している。本論文は現在、NeurIPS 2026ワークショップでの審査を受けている段階である。
参考: arXiv cs.AI (アーカイブ) — 2026年10月2日 13:00 (JST)