バオデ・ワン (Baode Wang) 氏らは2026年9月30日(現地時間)、ビジョン言語モデルにおけるOCR(光学文字認識)転写の忠実度を改善する新手法「GAD-RL」に関する論文をarXivで公開した。同手法は、ビジョン言語モデルが画像内の異常なテキストを言語的に妥当な表現に書き換えることで、OCR転写の忠実度が損なわれる問題に対処する。

この論文によると、シーケンスレベルのタスク報酬と局所的な教師ガイダンスは補完的だが、学生モデルの改善に伴い、固定された教師からのガイダンスが常に有効であるとは限らない。オフライン分析では、学生モデルの改善に伴い、固定教師からの監督が徐々に不利になることが示されている。

この観察に基づき、GAD-RLは、共同後学習中に学生モデルの現在のタスクパフォーマンスと局所分布に応じて教師の監督を適応的に調整する。具体的なメカニズムとして、タスク報酬が0.95以上の出力を含む応答グループでは蒸留を無効化し、グループ平均報酬の増加に伴って蒸留強度を継続的に減衰させる。また、学生モデルが教師モデルのTop-1トークンを支持する確率が低い場合に、局所補助更新を抑制するため、フォワードKLを学生モデルの確率で重み付けする。

Qwen3.5-2Bモデルを用いた評価では、GAD-RLはCHAOS-BenchにおいてMicro Recall 59.92%を達成した。これはGRPOおよびGRPO+OPD(固定重み)をそれぞれ8.45ポイント、4.43ポイント上回る数値である。さらに、OmniDocBench v1.6ではOverallスコア91.18を達成している。


参考: arXiv cs.AI (アーカイブ) — 2026年10月1日 13:00 (JST)

原文ハイライト

"GAD-RL achieves 59.92% Micro Recall on CHAOS-Bench, surpassing GRPO"

この記事をシェア
X はてブ LinkedIn