MMDiff、マルチモーダルモデル機能特定と制御フレームワークを発表
Hunar Batra氏らは8月10日(現地時間)、マルチモーダル大規模言語モデル (MLLMs) の内部機能の特定、監査、制御を目的としたフレームワーク「MMDiff」を発表した。MMDiffは、マルチモーダルなスパースオートエンコーダ (SAEs) を訓練することで、機能レベルのインターフェースとしてMLLMの振る舞いを検出し、制御することを可能にする。
Tag
2 件の関連記事
Hunar Batra氏らは8月10日(現地時間)、マルチモーダル大規模言語モデル (MLLMs) の内部機能の特定、監査、制御を目的としたフレームワーク「MMDiff」を発表した。MMDiffは、マルチモーダルなスパースオートエンコーダ (SAEs) を訓練することで、機能レベルのインターフェースとしてMLLMの振る舞いを検出し、制御することを可能にする。
ヤオ・シャオ(Yao Xiao)氏らが率いる研究チームは2026年7月30日(現地時間)、視覚言語モデルの視覚検索能力を改善する新たな手法「リトークン(ReToken)」に関する論文をarXivに発表した。ReTokenは、長期的な視覚コンテキストにおける計算負荷と性能低下の課題に対応するため、単一の学習可能な埋め込みとして設計されている。小規模な画像-QAデータセットのみで訓練され、画像および動画ベンチマークで一貫した性能向上を実現した。