MemFold、長文脈パーソナライズ向けのソフトメモリを行動から学習
導入
同じユーザーを長期間支援するアシスタントには、過去の発言を保存するだけでなく、現在も有効な好み、変更された好み、今回の依頼に適用すべき制約を見分ける能力が必要です。履歴をテキストのまま保持すれば、読者モデルに渡す入力は会話量に応じて増え続けます。一方、固定数の潜在ベクトルへ圧縮すればインターフェースは一定になりますが、従来の学習では原文の再構成や参照回答の模倣が目標になりやすく、実際の記憶利用行動とずれる可能性があります。
MemFoldは、記憶の品質を「どれだけ復元できるか」ではなく、「その記憶で何ができるか」で評価しようとします。
手法の要点
- 固定予算の記憶インターフェース:クエリに応じてテキスト記憶を条件付けし、K個の連続ベクトルへ圧縮します。読者モデルはこのベクトルを通じて履歴を参照するため、全履歴をそのまま入力する必要がありません。
- 学生自身の出力で最適化:ソフトメモリの条件下で学生モデルが自ら応答を生成し、そのロールアウトを訓練に使います。外部の正解系列だけを対象にする設計ではありません。
- 二つの補完的な信号:複数候補のタスク結果を比較するグループ相対報酬と、信頼度ゲート付きオンポリシー蒸留を組み合わせます。後者では、テキスト記憶を読める凍結教師が、学生がすでにサンプルしたトークンを再評価し、確信度が十分な場合だけ指導します。
- 推論時に教師は不要:教師は追加の回答を自己回帰生成せず、学生のトークンを採点する役割に限定されます。実運用では教師を取り除き、読者モデルと圧縮記憶だけを使います。
意義と残る論点
三つのQwenバックボーンを用いた評価で、論文はPersonaMem-32KとPersonaMem-128Kにおいて、測定対象の中でMemFoldが最も高い精度を達成したと報告しています。より長い履歴では差が広がり、目標ドメインでの追加学習なしにPrefEvalとLongMemEvalへ転移したとされます。これは、圧縮後の記憶が短いこと自体が問題なのではなく、下流の判断に合わせて学習されているかが重要だという示唆です。
テキスト記憶の教師は豊かな履歴情報を保持し、学生は限られたソフトメモリだけで行動する。この役割分担は、長期稼働するエージェントの学習と配備を分離する現実的な方法になり得ます。
ただし、提供された素材には完全なアブレーション、具体的な改善幅、メモリ予算ごとの比較は含まれていません。計算コストや好みの変化への頑健性、Kの選択への依存度は、論文本文で確認する必要があります。それでも、MemFoldの重要性は明確です。記憶圧縮を要約生成ではなく、現在のタスクで正しい行動を支える情報の保存として捉え直しています。
コメント
ログイン状態を確認中…
コメントを読み込み中…