ビデオ生成、アラインメントと蒸留統合の新手法「DM-Align」を開発
Jiuzhou Lin らは9月2日(現地時間)、ビデオ生成モデルにおける人間の嗜好とのアラインメントとモデル蒸留を単一ステージで統合する最適化フレームワーク「DM-Align」に関する研究成果をarXiv cs.CVで発表した。この新手法は、従来手法が抱えていた計算コストの増大やモデルの不安定化といった課題を解決することを目的としている。
Tag
8 件の関連記事
Jiuzhou Lin らは9月2日(現地時間)、ビデオ生成モデルにおける人間の嗜好とのアラインメントとモデル蒸留を単一ステージで統合する最適化フレームワーク「DM-Align」に関する研究成果をarXiv cs.CVで発表した。この新手法は、従来手法が抱えていた計算コストの増大やモデルの不安定化といった課題を解決することを目的としている。
研究論文「Context-Aware RL for Agentic and Multimodal LLMs」は6月15日(現地時間)、大規模言語モデル(LLM)の長文や複雑な文脈における情報特定、およびマルチモーダル推論の性能向上を目的とした新しい強化学習手法「ContextRL」を提案した。この手法は、モデルにクエリと回答、高い類似性を持つ二つのコンテキストを与え、クエリと回答を支持するコンテキストを選択できた場合に報酬を付与する。これにより、きめ細やかなグラウンディングを促すとしている。
Seojeong Park氏らの研究チームは2026年6月1日(現地時間)、マルチモーダル大規模言語モデル(MLLM)が評価者として機能する際に生じる「知覚判断バイアス (Perceptual Judgment Bias)」の軽減に関する研究論文を発表した。このバイアスは、視覚的証拠とテキスト情報が矛盾する状況で、MLLMが知覚的に正しい答えよりも、より一貫性のある物語を優先してしまう傾向として特定されており、評価の一貫性を著しく損なうと指摘されている。本研究はarXiv cs.CVで報じられ、ICML 2026での発表が予定されている。
Dingbang Wu氏らは2026年5月25日(現地時間)、ブラウザホスト型の新しいシミュレーションプラットフォーム「MobileGym(モバイルジム)」を発表した。これは学術論文公開サイトarXiv cs.AIで報じられた。このプラットフォームは、日常的なモバイル利用に焦点を当て、プロプライエタリなバックエンドを複製することなく、インタラクションの忠実性を追求する。構造化されたJSON状態に基づき、検証可能な結果シグナルとスケーラブルなオンライン強化学習 (RL) を実現する。
arxiv.orgは2026年5月19日(現地時間)、Xiaozhe Li氏らの研究チームが、オンポリシー強化学習手法に内在するモード崩壊の根本原因を特定し、これを克服する新たなアルゴリズム「DMPO (Distribution-Matching Policy Optimization)」を提案したと報じた。DMPOは多様な推論タスクにおいて、既存手法を一貫して上回る品質改善を達成し、強化学習の汎用性と安定性を大きく向上させる可能性を示唆している。
科学論文リポジトリのarXiv cs.LGが2026年5月20日(現地時間)付けで報じたところによると、大規模言語モデル(LLMs)の推論能力向上に用いられるGroup Relative Policy Optimization(GRPO)アルゴリズムにおける課題「advantage collapse」の診断と軽減策に関する研究論文が発表された。本研究では、この失敗モードを定量化する診断指標Advantage Collapse Rate(ACR)を導入し、Adaptive Virtual Sample Policy Optimization(AVSPO)を提案。AVSPOはGRPOと比較してadvantage collapseを58-63%削減し、精度を4-6パーセンテージポイント向上させると報告されている。
arXivは2026年5月12日(現地時間)、「AlphaGRPO」に関する研究論文を公開した。同フレームワークは、強化学習ベースのマルチモーダル生成モデルが直面する報酬設計の複雑さやコールドスタート問題を解決する。Group Relative Policy Optimization (GRPO) をAR-Diffusion Unified Multimodal Models (UMMs) に適用し、追加のコールドスタート段階なしに生成能力を向上させる。これにより、モデルは高度な推論と自律的な品質向上を実現する。
arXiv cs.CLは2026年5月7日(現地時間)、Mingwei Xu氏とHao Fang氏が、大規模言語モデル (LLM) の推論能力向上を目指す新しい強化学習フレームワーク「Positive-Only Policy Optimization (POPO)」を提案したと発表した。これは、検証可能な報酬を伴う強化学習 (RLVR) の領域において、既存手法Group Relative Policy Optimization (GRPO) の負のロールアウト問題を解決するもので、オンラインの正のロールアウトのみで学習を進める。