MMDiff、マルチモーダルモデル機能特定と制御フレームワークを発表
Hunar Batra氏らは8月10日(現地時間)、マルチモーダル大規模言語モデル (MLLMs) の内部機能の特定、監査、制御を目的としたフレームワーク「MMDiff」を発表した。MMDiffは、マルチモーダルなスパースオートエンコーダ (SAEs) を訓練することで、機能レベルのインターフェースとしてMLLMの振る舞いを検出し、制御することを可能にする。
Tag
9 件の関連記事
Hunar Batra氏らは8月10日(現地時間)、マルチモーダル大規模言語モデル (MLLMs) の内部機能の特定、監査、制御を目的としたフレームワーク「MMDiff」を発表した。MMDiffは、マルチモーダルなスパースオートエンコーダ (SAEs) を訓練することで、機能レベルのインターフェースとしてMLLMの振る舞いを検出し、制御することを可能にする。
Appleは2026年8月(現地時間)、マルチモーダル大規模言語モデル(MLLM)におけるアラインメントに関する包括的な研究を発表した。大規模言語モデル(LLM)の性能向上に不可欠な選好アラインメントについて、MLLMでの影響はこれまで十分に探求されてこなかった。本研究は、MLLMが画像理解タスクで直面するハルシネーション(誤った情報の生成)などの課題に対し、モデルの応答を画像情報により正確に一致させることを目的とする。特に、追加のアノテーションや外部モデルを必要としない新しいマルチモーダル選好データ作成手法「Bias-Driven Hallucination Sampling (BDHS)」を導入し、エッジデバイスでのMLLM実用化への道を拓く可能性を示唆している。
arXiv cs.CVは2026年7月25日(現地時間)、Wenping Yin氏らによる研究論文「DisasterTD: Disaster Toponym Disambiguation Using Multimodal LLMs and Cross-View Geolocalization」を発表しました。本研究は、マルチモーダル大規模言語モデル (Multimodal LLMs) と視点間ジオロケーションを統合し、ソーシャルメディア画像 (SMI) における曖昧な地理的参照を解決するフレームワーク「DisasterTD」を提案。災害対応における迅速かつ高精度な状況認識に貢献します。
arXiv cs.CVが2026年7月28日(現地時間)、マルチモーダル大規模言語モデル(MLLM)の原子レベル視覚知覚能力を評価する新しいベンチマーク「パーセプションベンチ (PerceptionBench)」を発表した。既存のベンチマークが推論やドメイン知識の問題と知覚エラーを混同する点を指摘し、純粋な知覚能力の評価を目指す。42の既存ベンチマークからMLLMの初期の失敗点を分析し、知覚に関する10の原子レベル能力を定義した。
Apple ML Researchは2026年7月(現地時間)、一人称視点(egocentric)ビデオ理解モデルにおける時間的認識を促進する新アルゴリズム「Temporal Global Policy Optimization (TGPO)」を発表した。マルチモーダル大規模言語モデル(MLLMs)が視覚理解で優れた性能を示す一方、時間的推論の不足が課題とされており、TGPOはこの課題に対処する。これはAR/VRデバイスにおける次世代AIアシスタントの基盤技術となる可能性を秘める。
チャン・ニエ (Chang Nie) 氏らは2026年7月6日(現地時間)、学術論文公開サイトarXiv cs.CVにて、長期記憶を持つエージェント型動画理解のためのマルチモーダルエージェントフレームワーク「Light-Omni」を発表した。同フレームワークは、従来の反復推論に代わる反射的かつ軽量な動画理解を実現し、デュアル文脈状態を用いて単一フォワードパスで必要な文脈を構築する。
arXiv cs.LGは4月20日(現地時間)、論文を公開し、マルチモーダル大規模言語モデル (MLLM) の知識編集において、既存手法では十分に解決されていない「editing decoupling failure」と呼ばれる問題が存在すると指摘しました。この問題は、多モーダル入力で知識が更新されても、単一モーダル入力では古い情報に逆戻りする現象を指します。論文では、この課題に対処するため、モダリティ固有のニューロン群を分離・特定する新手法「DECODE」を提案しています。
論文投稿サイトarXivのコンピュータビジョン部門は6月2日(現地時間)、研究論文を公開し、ワールドモデルとマルチモーダル大規模言語モデル (MLLMs) が静的な視覚情報からの将来予測において相補的な能力を発揮すると発表した。既存のワールドモデルによる視覚的シミュレーションは、見た目のもっともらしさがある一方で、実際のタスクにおいては不正確となる課題があった。研究チームはこの課題を「制御された具体的推論」として定式化。これに対応するため、真の未来情報を訓練時に活用する新手法「Privileged-Future On-Policy Self-Distillation (PF-OPSD)」を提案した。
arXiv cs.CVは2026年6月1日(現地時間)、Yu-Cheng Shi (ユーチェン・シー) 氏ら研究者グループが、マルチモーダル大規模言語モデル (MLLMs) の継続的な指示チューニング (MCIT) における課題を解決する新たなフレームワーク「ProtoAda」を提案したと報じた。本フレームワークは、既存手法が抱えるタスク間の干渉や非効率な専門家連携の問題に対し、タスクのセマンティクスと出力構造の両方を考慮することで、優れた性能を実現するという。