arXiv論文、LLMの文脈依存型アンラーニング手法に限界指摘
arXiv cs.CL は2026年8月20日(現地時間)、サヒル・カレ氏らが発表した論文「ConceptGuard: Benchmarking Context-Sensitive Unlearning in Large Language Models」を公開した。この論文は、大規模言語モデル (LLM) における有害知識の選択的除去(アンラーニング)に関する既存手法の限界を指摘。既存ベンチマークが事実の直接想起に偏り、有害な振る舞いを排除しつつ有益な知識を保持するというアンラーニングの主要要件を捉えきれていないと主張している。