EngramEdit、LLMの事実知識を独立して更新可能に
導入
大規模言語モデルの事実知識を更新する場合、通常は再学習やファインチューニング、あるいはモデル編集手法によってパラメータを変更します。しかし、こうした方法では計算コストが発生するだけでなく、新しい事実を学習した結果として既存知識や汎用能力が損なわれる可能性があります。EngramEditは、Transformerの本体を変更せず、条件付きメモリ側を編集することで、知識の保存と一般的な計算を切り分けようとします。
条件付きメモリの可能性と課題
DeepSeek Engramのようなアーキテクチャは、入力中のn-gramを手がかりに学習済み埋め込みを検索し、言語モデルに提供します。追加計算を大きく増やさずに容量を拡張できる点に加え、事実知識をTransformer本体から分離して保持できる可能性があります。
ただし、知識編集は単一ベクトルの書き換えでは済みません。同じ事実を表す文でも表現が異なれば、別のn-gram埋め込みが呼び出されることがあります。一方、ひとつの埋め込みが複数の事実に共有される場合もあります。そのため、特定の入力だけを対象に更新すると未見の表現へ一般化できず、共有埋め込みを直接変更すると無関係な予測まで変わり得ます。
EngramEditの仕組み
EngramEditは、主に次の手順で編集します。
- まず、更新後の事実をモデルに予測させるための目標メモリ表現を計算します。単一の言い回しではなく、複数の表現を考慮します。
- 次に、対象となる表現や編集タスクの間で、それらの目標に近づくよう共有n-gram埋め込みを共同で更新します。
- 多く再利用される埋め込みには強いペナルティを与え、無関係な知識への影響を抑えます。
つまり、ひとつのプロンプトに対する局所的な修正ではなく、複数の表現に共通するメモリ構造を対象にする点が特徴です。
結果と意味
論文によれば、EngramEditは対象事実の編集でほぼ完全に近い成功率を示しました。更新された知識は未見の表現でも利用でき、多段推論にも適用できます。Chain-of-Thoughtプロンプトでは、最も強いベースラインの約3倍に近い精度が報告されています。また、編集が蓄積しても、無関係な知識や汎用能力は概ね維持されました。
この研究が示す重要な方向性は、モデル更新の対象を全パラメータから条件付きメモリへ移せる可能性です。事実知識を比較的独立した層で管理できれば、継続的な情報修正やドメイン知識の保守を、モデル本体を繰り返し変更せずに行えるかもしれません。
一方、提供された素材だけでは、より大規模なモデル、異なる種類の事実、長期的な連続編集での挙動までは判断できません。共有埋め込みを介した干渉を複雑な知識ネットワークでも抑えられるかは、今後の検証課題です。
コメント
ログイン状態を確認中…
コメントを読み込み中…