記事一覧へ戻る
メモリ・コンテキスト

Context Language Models:モデル自身が文脈を管理する新しい設計

読了目安 3 分

導入

コンテキストウィンドウを拡大すれば、必ずしも記憶の質が高まるわけではない。長時間にわたって閲覧、コーディング、協調を行うエージェントにとって重要なのは、どの情報を残し、何を圧縮し、何を削除するかを判断することだ。現在の多くのシステムでは、その役割を外部ハーネス、要約器、検索器、あるいは人手で設計したルールが担っている。Context Language Models(CLM)は、この判断を言語モデル自身に委ねる。

文脈をファイルとして扱う

CLM の中心的な考え方は、文脈を一つのファイルとして表現し、モデルにその内容を制限なく更新させることだ。モデルは履歴を読むだけでなく、タスクの進行に合わせて情報を整理し、書き換え、維持できる。固定的な切り詰め、要約、検索の組み合わせではなく、文脈管理そのものがモデルの行動になる。

この抽象化はマルチエージェント環境にも拡張できる。各エージェントが個別の文脈ファイルを持てば、タスク状態や情報の境界を分けて管理できる。また、文脈管理の方針を外部コントローラーにすべて埋め込むのではなく、文脈内学習やモデルのパラメーターを通じて学習する道も開かれる。

実験結果と最適化

論文の要約によると、既存モデルからゼロショットで構築した CLM は、複数の評価で既存の文脈管理手法を上回った。

  • BrowseComp-Plus では、精度が 11.4% 高く、FLOPs は 21.5% 少ない。
  • 12 時間の EdgeBench では、スコアが 5% 向上し、FLOPs は 59% 減少した。
  • 24 時間の複数リポジトリ agent-swarm 課題では、同じ計算量で改善幅が 65% 大きかった。

さらに、標準的な技能最適化ループによって、文脈管理の自然言語指示を改良できる。要約では、文脈管理タスクの未見データにおいて最大 35.9 ポイントの精度向上と計算量削減が報告されている。オンライン強化学習では、Qwen3.5-9B の BrowseComp-Plus 性能が 47.6% 向上し、FLOPs は 12% 少なくなった。

推論時の効率化としては、CLM 向けに Suffix Cache Reuse も提案された。同等の性能で標準 SGLang と比較すると、サーバー側の計算量をさらに 35% 削減できるという。文脈を自由に更新させても、推論コストが必ずしも比例して増えるわけではないことを示す結果だ。

意義と今後の課題

CLM は、モデルとエージェント基盤の役割分担を見直す提案である。外部システムが一律のメモリーポリシーを決める代わりに、モデルがタスクに応じて情報の配置を変えられる。長時間動作するエージェント、コーディング支援、複数エージェントの協調に共通する基盤となる可能性がある。

一方、提供された素材には、各ベンチマークの詳細設定、ファイル更新の具体的な仕組み、タスク別の誤差分布は含まれていない。したがって、現時点では長期記憶や信頼性を完全に解決した手法ではなく、有望なシステム設計として捉えるべきだろう。重要情報の誤削除を防ぐ方法、変更履歴の監査、複雑な環境での安定性は今後の検証課題になる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
PISA、ブロック疎注意を O(N log N) の対数線形複雑度へ
メモリ・コンテキスト
cctest.ai

PISA、ブロック疎注意を O(N log N) の対数線形複雑度へ

ByteDance Seed の研究チームが、粗い候補から細かい候補へ段階的に絞り込む PISA を提案しました。ピラミッド型 Top-K 選択により、長文脈モデルにおけるブロック選択の二次コストを抑えます。

続きを読む
CCTest · Blog
JitMem:LLMエージェントが必要な時に記憶を編集する仕組み
メモリ・コンテキスト
cctest.ai

JitMem:LLMエージェントが必要な時に記憶を編集する仕組み

多くのエージェントは、将来の質問を知らないままタスク終了時に経験を要約します。JitMemは生の軌跡を保持し、新しいタスクが現れた時点で必要な記憶だけを再構成します。

続きを読む
CCTest · Blog
LatentPort、KVキャッシュを超えたモデル間メモリ引き継ぎを検証
メモリ・コンテキスト
cctest.ai

LatentPort、KVキャッシュを超えたモデル間メモリ引き継ぎを検証

LatentPort は、受け手のモデルが過去のプレフィックスを再読しなくても、別のモデルから実行時の内部状態を引き継げるかを検証した。Qwen3.5 4B から 9B への実験では、KV キャッシュに加えて再帰状態と畳み込み状態を移すことで、ネイティブ 9B との差を大きく縮めた。

続きを読む