リサーチ・論文

PaperGym、科学論文から研究計画を生成する進化型フレームワークを発表

Yuhan Wang氏らは8月31日(現地時間)、arXiv cs.CLで論文「PaperGym: Rubric-Centered Evolution for Research-Plan Generation」を公開し、研究計画生成のための統一フレームワーク「PaperGym」を発表した。同フレームワークは科学論文の構造を活用し、質問を研究目標と背景から、評価基準を手法と実験から導出。これにより基準漏洩を3.7%に抑え、Qwen3-8BモデルがResearchQAで73.48を記録し、既存モデルを上回る性能を示した。

リサーチ・論文

強化学習蒸留の新手法「Relay-OPD」発表、性能と効率向上

arXiv cs.CLが2026年7月28日(現地時間)、強化学習における新しい蒸留手法「Relay On-Policy Distillation (Relay-OPD)」に関する論文を発表した。この手法は、従来のOn-policy distillation (OPD) が抱える「prefix failure」という課題を克服するために、教師モデルと学生モデルの挙動の非対称性を活用する。これにより、数学的推論ベンチマークにおいて既存手法を上回る性能を示し、トレーニングの効率も向上させた。

ベンダー・製品

NVIDIA、Nemotron-Labs Diffusionを発表 高速テキスト生成と並列処理を実現

NVIDIAは2026年5月23日(現地時間)、拡散言語モデル(DLM)を基盤とする新たなテキスト生成モデル「ネモトロン・ラボ・ディフュージョン(Nemotron-Labs Diffusion)」を発表した。従来の自己回帰型(AR)モデルとは異なり、このモデルは複数のトークンを並列で生成し、反復的に改善する方式を採用する。これにより、現代のGPUにおける計算モデルを効率的に活用し、ランタイム性能の大幅な向上と、既存テキストの修正能力を提供するとしている。