arXiv cs.CLは10月7日(現地時間)、大規模言語モデル (LLM) において、事実知識と汎用計算の機能を分離することで、知識更新の効率化と正確性を高める新手法「EngramEdit (エングラムエディット)」が提案されたと発表した。この手法は、モデルの基盤となるTransformer backbone (トランスフォーマーバックボーン) を固定したまま、共有埋め込みの相互干渉によって発生していた従来の知識更新における課題を解決することを目指す。EngramEditは、条件付きメモリを活用し、特定の知識更新が他の既存知識や推論能力に与える悪影響を最小限に抑える設計となっている。

エングラムエディット (EngramEdit) は、条件付きメモリを介して、大規模言語モデル (LLM) における知識の分離更新を実現するアーキテクチャである。従来のLLMでは、異なる事実表現が共有されるn-gram (エヌグラム) 埋め込みを活性化し、この共有埋め込みの更新が意図せず他の事実に関するモデル予測を変えてしまうという課題があった。EngramEditは、この相互干渉の問題を解決することを目指す。

具体的には、EngramEditは二段階のプロセスで動作する。まず、モデルが複数の表現にわたって更新された事実を正確に予測できるよう、ターゲットとなるメモリ表現を計算する。次に、これらのターゲット表現と一致するように、共有のn-gram埋め込みを共同で更新する。この更新プロセスでは、無関係な既存知識の保持を最優先するため、頻繁に再利用される埋め込みへの更新に対しては、より強いペナルティが課される。これにより、特定の部分的な知識更新がモデル全体の性能や他の知識に与える影響を最小限に抑えることを狙う。

実験の結果、EngramEditは独立した事実知識更新において、ほぼ完璧な編集成功率を達成したと研究者らは報告している。この成功率は、修正された知識が、これまでモデルが学習したことのない未見の表現形式や、複数のステップを要する複雑なマルチホップ推論タスクにおいても利用可能であることを示唆する。さらに、思考連鎖 (CoT: chain-of-thought) プロンプトを適用した際の精度は、最も強力なベースラインモデルと比較して約3倍に達したという。これは、複雑な推論能力と事実知識の統合において、EngramEditが顕著な優位性を持つことを示す。

重要な点として、この手法では、事実知識の更新が繰り返し蓄積されても、モデルが持つ無関係な既存知識と、一般的な推論能力が大幅に維持されることが確認された。従来の知識編集手法では、特定の知識を更新する際に他の知識が損なわれたり、モデルの汎用能力が低下したりする壊滅的忘却 (catastrophic forgetting) の問題が指摘されてきたが、EngramEditはこの問題を効果的に回避している。

これらの発見は、EngramEditが条件付きメモリの役割を、単なるモデルのスケーリングを超えた「編集可能な知識インターフェース」へと転換させる可能性を示唆する。この手法は、LLMの知識ベースを動的に、かつ安全に更新する新たな可能性を示すものとされている。


参考: arXiv cs.CL — 2026年10月8日 02:58 (JST)

原文ハイライト

"Decoupled Knowledge Updates in LLMs through Conditional Memory"

この記事をシェア
X はてブ LinkedIn