リサーチ・論文

Apple、マルチモーダルLLMのハルシネーション対策研究を発表 — 独自データ生成で実用化に道

Appleは2026年8月(現地時間)、マルチモーダル大規模言語モデル(MLLM)におけるアラインメントに関する包括的な研究を発表した。大規模言語モデル(LLM)の性能向上に不可欠な選好アラインメントについて、MLLMでの影響はこれまで十分に探求されてこなかった。本研究は、MLLMが画像理解タスクで直面するハルシネーション(誤った情報の生成)などの課題に対し、モデルの応答を画像情報により正確に一致させることを目的とする。特に、追加のアノテーションや外部モデルを必要としない新しいマルチモーダル選好データ作成手法「Bias-Driven Hallucination Sampling (BDHS)」を導入し、エッジデバイスでのMLLM実用化への道を拓く可能性を示唆している。

リサーチ・論文

災害地名曖昧性解消フレームワーク「DisasterTD」発表

arXiv cs.CVは2026年7月25日(現地時間)、Wenping Yin氏らによる研究論文「DisasterTD: Disaster Toponym Disambiguation Using Multimodal LLMs and Cross-View Geolocalization」を発表しました。本研究は、マルチモーダル大規模言語モデル (Multimodal LLMs) と視点間ジオロケーションを統合し、ソーシャルメディア画像 (SMI) における曖昧な地理的参照を解決するフレームワーク「DisasterTD」を提案。災害対応における迅速かつ高精度な状況認識に貢献します。

リサーチ・論文

arXiv、マルチモーダル大規模言語モデルの視覚知覚能力評価ベンチマーク「PerceptionBench」を発表

arXiv cs.CVが2026年7月28日(現地時間)、マルチモーダル大規模言語モデル(MLLM)の原子レベル視覚知覚能力を評価する新しいベンチマーク「パーセプションベンチ (PerceptionBench)」を発表した。既存のベンチマークが推論やドメイン知識の問題と知覚エラーを混同する点を指摘し、純粋な知覚能力の評価を目指す。42の既存ベンチマークからMLLMの初期の失敗点を分析し、知覚に関する10の原子レベル能力を定義した。

リサーチ・論文

Apple ML Research、一人称視点ビデオ理解を革新する「TGPO」を発表

Apple ML Researchは2026年7月(現地時間)、一人称視点(egocentric)ビデオ理解モデルにおける時間的認識を促進する新アルゴリズム「Temporal Global Policy Optimization (TGPO)」を発表した。マルチモーダル大規模言語モデル(MLLMs)が視覚理解で優れた性能を示す一方、時間的推論の不足が課題とされており、TGPOはこの課題に対処する。これはAR/VRデバイスにおける次世代AIアシスタントの基盤技術となる可能性を秘める。

リサーチ・論文

Light-Omni、長期記憶を持つ反射型動画理解フレームワーク発表

チャン・ニエ (Chang Nie) 氏らは2026年7月6日(現地時間)、学術論文公開サイトarXiv cs.CVにて、長期記憶を持つエージェント型動画理解のためのマルチモーダルエージェントフレームワーク「Light-Omni」を発表した。同フレームワークは、従来の反復推論に代わる反射的かつ軽量な動画理解を実現し、デュアル文脈状態を用いて単一フォワードパスで必要な文脈を構築する。

リサーチ・論文

MLLM知識編集の難題「Editing Decoupling Failure」をDECODEが克服

arXiv cs.LGは4月20日(現地時間)、論文を公開し、マルチモーダル大規模言語モデル (MLLM) の知識編集において、既存手法では十分に解決されていない「editing decoupling failure」と呼ばれる問題が存在すると指摘しました。この問題は、多モーダル入力で知識が更新されても、単一モーダル入力では古い情報に逆戻りする現象を指します。論文では、この課題に対処するため、モダリティ固有のニューロン群を分離・特定する新手法「DECODE」を提案しています。