arXiv cs.AI は2026年10月4日(現地時間)、テキスト-画像生成システムにおける安全性確保の課題に関する研究論文を発表した。NaHyeon Park氏らが執筆したこの論文は、既存の「グローバルな安全性」に基づく防御策が抱える限界を幾何学的分析で明らかにし、新しい手法「CALM (Counterfactual Adaptive Local Modulation)」を提案。不適切なコンテンツの抑制と、良性プロンプトの有用性保持を両立させる狙いがある。
NaHyeon Park氏らの研究チームは、テキスト-画像生成におけるトレーニング不要の安全性確保手法が、再利用可能な安全性信号に依存し、広範囲にプロンプトへ適用される「グローバルな安全性」の仮定に着目した。 この仮定について幾何学的な分析を行った結果、consistent coverage-selectivity trade-offが存在することが明らかになった。すなわち、コンパクトな安全でない部分空間では多様な不適切な意味をカバーできず、より広範な集約は安全性に関連する良性プロンプトを歪めるという課題が指摘された。
この知見に基づき、研究チームはCALM (Counterfactual Adaptive Local Modulation)を提案した。CALMは、均一なグローバル除去に代わり、プロンプトに局所的な反事実的修正を行うトレーニング不要の安全確保手法である。このシステムは、一致する不適切-良性アンカー (matched unsafe-benign anchors) を利用し、各プロンプトをアクティブな不適切カテゴリにルーティングする。その上で、違反するトークン表現のみを最小限に修正し、安全な方向へ導き、積極的に整列された不適切な残留成分を抑制する。
広範な評価において、CALMは不適切なコンテンツの抑制を大幅に改善すると同時に、良性コンテンツの有用性 (benign utility) を維持した。この結果は、局所的な反事実的修正が、グローバルな安全性信号の除去に対して、より選択的な代替手段を提供することを示している。本研究は、NeurIPS 2026にて発表される予定。
参考: arXiv cs.AI (アーカイブ) — 2026年10月5日 13:00 (JST)
原文ハイライト"Counterfactual Adaptive Local Modulation"