CacheBack、受信側が必要とするKVキャッシュだけを多エージェント間で転送
複数のエージェントが協調してタスクを解く場合、課題は情報を送れるかどうかだけではありません。どの情報を、どれだけ送るかも重要です。あるエージェントが長い文脈を処理していても、次のエージェントが必要とするのは、その一部だけかもしれません。処理した内容をすべて転送すれば、通信自体がメモリと遅延のボトルネックになります。
テキスト通信と潜在通信
一般的な方法では、送信側が情報を文章に要約し、受信側がそれを読み取ります。テキストは扱いやすく、内容の確認もしやすい一方、生成のためのデコード処理が必要です。また、要約によって受信側が必要とする証拠や細部が失われる可能性があります。
近年の潜在通信では、文章を新たに生成する代わりに、モデル内部の状態、とりわけKVキャッシュをエージェント間で渡します。これによりテキスト生成の一部を省き、要約で失われる情報を保持できる可能性があります。しかし完全なキャッシュは、各エージェントが扱う文脈の長さと、協調に参加するエージェント数の両方に応じて増加します。GPUメモリや受信側のコンテキスト長を圧迫する点が問題になります。
受信側の要求を選別基準にする
論文の中心的な考え方は、送信側が持つ情報の全量ではなく、受信側のローカルタスクが必要とする情報だけを送ることです。受信エージェントはまず、自分が必要とする情報を短い説明として送信側に伝えます。送信側はその要求を手がかりに、転送対象のキャッシュを選別・圧縮します。
CacheBackは、この受信側条件付けを追加学習なしで実装する方法です。送信側の注意重みを関連性の指標として利用し、受信側の要求に関係しやすい状態を残します。専用の通信エンコーダーを学習するのではなく、「送信側が何を処理したか」から「受信側に何が役立つか」へ、転送の基準を変える設計です。
実験結果と意味
FanOutQAでQwen 3を使った実験では、CacheBackは本来受信する状態の75%を削減しました。論文は、テキスト通信と比べて精度が14.7ポイント向上し、タスク完了時間の中央値が3.2倍短くなったと報告しています。さらに、密なTransformer、Mambaと注意機構のハイブリッド、スライディングウィンドウ注意を含む複数のモデル系統で、同じ方向の改善が示されています。
この研究が示す実用的な原則は、エージェント間通信を完全性ではなく受信側のタスクで制御することです。大きな中間状態を頻繁に交換する構成では、メモリ使用量、コンテキスト圧力、待ち時間の低減につながる可能性があります。一方、提供された情報だけでは、圧縮率やタスク、異なるモデルの組み合わせによる性能限界までは判断できません。実運用では、キャッシュ互換性、選別ミス、統合コストの検証が必要です。
コメント
ログイン状態を確認中…
コメントを読み込み中…