Context Language Models:モデル自身が文脈を管理する新しい設計
導入
コンテキストウィンドウを拡大すれば、必ずしも記憶の質が高まるわけではない。長時間にわたって閲覧、コーディング、協調を行うエージェントにとって重要なのは、どの情報を残し、何を圧縮し、何を削除するかを判断することだ。現在の多くのシステムでは、その役割を外部ハーネス、要約器、検索器、あるいは人手で設計したルールが担っている。Context Language Models(CLM)は、この判断を言語モデル自身に委ねる。
文脈をファイルとして扱う
CLM の中心的な考え方は、文脈を一つのファイルとして表現し、モデルにその内容を制限なく更新させることだ。モデルは履歴を読むだけでなく、タスクの進行に合わせて情報を整理し、書き換え、維持できる。固定的な切り詰め、要約、検索の組み合わせではなく、文脈管理そのものがモデルの行動になる。
この抽象化はマルチエージェント環境にも拡張できる。各エージェントが個別の文脈ファイルを持てば、タスク状態や情報の境界を分けて管理できる。また、文脈管理の方針を外部コントローラーにすべて埋め込むのではなく、文脈内学習やモデルのパラメーターを通じて学習する道も開かれる。
実験結果と最適化
論文の要約によると、既存モデルからゼロショットで構築した CLM は、複数の評価で既存の文脈管理手法を上回った。
- BrowseComp-Plus では、精度が 11.4% 高く、FLOPs は 21.5% 少ない。
- 12 時間の EdgeBench では、スコアが 5% 向上し、FLOPs は 59% 減少した。
- 24 時間の複数リポジトリ agent-swarm 課題では、同じ計算量で改善幅が 65% 大きかった。
さらに、標準的な技能最適化ループによって、文脈管理の自然言語指示を改良できる。要約では、文脈管理タスクの未見データにおいて最大 35.9 ポイントの精度向上と計算量削減が報告されている。オンライン強化学習では、Qwen3.5-9B の BrowseComp-Plus 性能が 47.6% 向上し、FLOPs は 12% 少なくなった。
推論時の効率化としては、CLM 向けに Suffix Cache Reuse も提案された。同等の性能で標準 SGLang と比較すると、サーバー側の計算量をさらに 35% 削減できるという。文脈を自由に更新させても、推論コストが必ずしも比例して増えるわけではないことを示す結果だ。
意義と今後の課題
CLM は、モデルとエージェント基盤の役割分担を見直す提案である。外部システムが一律のメモリーポリシーを決める代わりに、モデルがタスクに応じて情報の配置を変えられる。長時間動作するエージェント、コーディング支援、複数エージェントの協調に共通する基盤となる可能性がある。
一方、提供された素材には、各ベンチマークの詳細設定、ファイル更新の具体的な仕組み、タスク別の誤差分布は含まれていない。したがって、現時点では長期記憶や信頼性を完全に解決した手法ではなく、有望なシステム設計として捉えるべきだろう。重要情報の誤削除を防ぐ方法、変更履歴の監査、複雑な環境での安定性は今後の検証課題になる。
コメント
ログイン状態を確認中…
コメントを読み込み中…