記事一覧へ戻る
メモリ・コンテキスト

Jev-Mem:System Oneで制御する効率的なAIエージェント記憶

読了目安 3 分

導入

長期的に動作するAIエージェントには、単なるコンテキスト保持以上の記憶が必要です。ユーザーの好み、過去の出来事、情報同士の関係を保存し、必要な場面で取り出さなければなりません。しかし従来のエージェント記憶では、記憶の作成、整理、検索の多くを自己回帰型の大規模言語モデルに依存する場合があります。定型的な操作にも生成処理が入るため、コストと遅延が増える可能性があります。

Jev-Memは、この問題にSystem OneとSystem Twoの役割分担を適用します。頻繁に発生する軽量な判断は専用コントローラーに任せ、意味理解や回答の統合が必要な場面だけ、より重い推論処理を呼び出します。

3つのプレーン

Jev-Memは次の3要素で構成されます。

  • System-One制御プレーン:構築時には記憶のタイプを決め、記憶間の関係を整理します。検索時にはクエリの振り分け、検索予算の配分、グラフ探索、候補のスコアリング、検索終了の判断を行います。
  • 多関係記憶プレーン:情報を独立したテキスト断片としてだけ扱わず、複数の関係を持つ構造化された記憶として保持します。
  • System-Two推論プレーン:複雑な推論と回答の統合に限定して利用されます。

ポイントは、言語モデルを記憶から排除することではありません。どの処理に言語モデルを使うかを整理することです。System Oneが繰り返し発生する制御判断を担当し、System Twoは取得した情報の解釈や回答作成に集中します。これにより、単純な記憶操作のたびに高コストな生成を実行する必要を減らせます。

評価結果と意義

LoCoMoでは、Jev-Memの総合LLM-as-a-Judgeスコアは0.777で、最も強いベースラインに対して相対11.0%の向上を示しました。記憶構築時間は158秒で、概要によれば最速の競合システムに対して6.6倍の高速化です。平均クエリ遅延は0.93秒で、36.7%削減されたと報告されています。

この結果は、エージェント記憶の効率化が、より強力な生成モデルを使うことだけで実現するものではないことを示します。不要な生成呼び出しを抑え、検索予算や探索、停止を明示的に制御することも重要です。Jev-Memは、記憶を単純なベクトル検索層ではなく、タイプ、関係、予算、探索方針を持つ動的なシステムとして捉えています。

一方、提供された情報で主に示されているのはLoCoMoでの結果です。異なる分野やモデル、大規模な記憶ストアで同じ効果が得られるかは、今後の検証が必要です。コードとインタラクティブなHugging Face Spaceは公開されており、再現実験の基盤になります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
DeepSeek-V4.1-Flash、長文脈エージェント向けKVキャッシュ圧縮を追求
メモリ・コンテキスト
cctest.ai

DeepSeek-V4.1-Flash、長文脈エージェント向けKVキャッシュ圧縮を追求

DeepSeek-V4.1-Flashは、長時間動作するエージェントで問題となる事前計算、KVキャッシュ、ストレージ、帯域幅の負担を対象にしたモデルです。CED、層間KV再利用、FP4キャッシュ、SWA Bounded Replayを組み合わせ、キャッシュ容量の大幅な削減を目指します。

続きを読む
CCTest · Blog
Grouped Value Attention、キーのオンデマンド再構成でKV Cacheを圧縮
メモリ・コンテキスト
cctest.ai

Grouped Value Attention、キーのオンデマンド再構成でKV Cacheを圧縮

Grouped Value Attention(GVA)は、グループ化したValueを保存し、学習済みの線形写像からContent Keyを必要に応じて再構成する手法です。報告された構成では、GQAに近い精度を保ちながら、永続キャッシュのスカラー数を約45〜47%削減しました。

続きを読む