リサーチ・論文

長文推論向け蒸留手法「GC-OPD」を提案、Qwen3モデルの性能向上を確認

arXivが2026年8月19日(現地時間)付けで報じたところによると、Zhu Zhang氏らの研究チームは、長文コンテキスト推論におけるオンポリシー蒸留 (On-policy distillation、OPD) の課題を解決する新手法「Group-Calibrated On-Policy Distillation (GC-OPD)」を発表した。この手法は、教師モデルのトークンレベルのガイダンスとタスク固有の検証器 (verifier) 報酬との不一致を解消し、モデルの性能向上を目指す。既存のQwen3-4BおよびQwen3-8Bチェックポイントに適用した結果、複数のベンチマークで平均スコアが大幅に改善されたと報告されている。

リサーチ・論文

リコンテキスト、長文コンテキスト推論を改善する新手法を提案

リコンテキスト (ReContext) の研究チームは2026年7月2日(現地時間)、大規模言語モデル (LLM) の長文コンテキスト推論を改善する推論手法「RECONTEXT」を発表した。この手法は、モデル内部の関連性シグナルを活用し、クエリに応じた証拠プールを構築して最終生成前にリプレイすることで、トレーニング不要で効果的なコンテキスト利用を実現する。8つの長文データセットを用いた実験では、Qwen3-4B、Qwen3-8B、Llama3-8Bといったモデルにおいて、証拠利用の一貫した改善が確認された。