arXiv cs.AIは9月25日(現地時間)、パーサ・ホセイニ (Parsa Hosseini) らが発表した研究論文で、推論モデルの生成トークン数を最大25%削減しつつ、Gemma、Qwen、Nemotron、GPT-OSSといったモデルで同等の精度を維持する新たな手法を提案したと報じた。この手法は自己教師ありの信頼性訓練を利用し、推論効率の大幅な改善を実現する。
推論モデルは通常、計算コストが高いとされる長い推論トレースを生成する傾向がある。これまでのアプローチでは、推論時の早期停止メカニズムの導入や、訓練中に短い推論を明示的に促す強化学習、長さペナルティの適用などにより、効率改善が試みられてきた。
この研究では、既存手法とは異なる「信頼性」という監視を通じて、実質的な効率向上が得られることを示している。具体的には、自己教師ありのプロセスを活用し、わずか600の訓練問題のみを用いて、推論モデルが自身の推論経路の中間点で回答に対する信頼性を予測するようにファインチューニングされた。この信頼性は訓練目標としてのみ機能し、損失関数には推論長、効率、停止といった直接的な目的は一切含まれていない。
推論時において、ファインチューニングされたモデルは標準的な生成手順を使用しており、特別な信頼性引き出し機能や早期停止メカニズムは組み込まれていない。それにもかかわらず、自己教師あり信頼性ファインチューニングは、数学的、科学的、コーディング推論の各ベンチマークにおいて、Gemma、Qwen、Nemotron、GPT-OSSといった主要モデルで、同等の精度を維持しつつ生成トークン数を最大25%削減し、推論プロセスをより効率的にした。この効率向上は、短い推論を明示的に最適化する手法に匹敵するレベルであると報告されている。
推論エピソードの分析からは、信頼性監視が、特定の振る舞いを抑制するのではなく、ベースモデルが持つ高レベルな推論構成を大幅に維持していることが示された。この成果は、効率的な推論が、直接的な最適化なしに、メタ認知信号の学習がもたらす二次的な結果として生じる可能性を示唆する。
参考: arXiv cs.AI — 2026年9月26日 02:59 (JST)
原文ハイライト"Self-Supervised Confidence Training Improves Reasoning Efficiency"