大規模言語モデルの反例生成、模倣学習の課題と強化学習による改善手法
arXivは2026年10月4日(現地時間)、Omar Farouk Zouak氏らによる研究論文「Counterexample Generation via Per-Theorem Symbolic Verifiers: When Imitation Hurts and Reinforcement Repairs」を発表した。本研究は、大規模言語モデル (LLM) が定理の真偽判定において反例生成に課題を抱える「偽証ギャップ」に焦点を当て、教師ありファインチューニング (SFT) がこれを悪化させる可能性を指摘している。検証器を報酬関数とする新たなコーパス「SymCE」を公開し、強化学習によって反例生成能力が改善されることを示した。