DeepSeek-V4.1-Flash、長文脈エージェント向けKVキャッシュ圧縮を追求
導入
長文脈モデルの課題は、単に大量のトークンを入力できるかどうかだけではありません。入力をどのように計算し、どの情報を保持し、メモリ階層の間でどう転送するかも、実運用のコストを左右します。特に長時間動作するエージェントでは、ツールの結果や中間ステップ、過去の会話を何度も参照するため、出力より入力が多いワークロードになりやすい傾向があります。
DeepSeek-V4.1-Flashは、こうした負担をKVキャッシュの圧縮を中心に解決しようとするモデルです。552Bのバックボーンを持つマルチモーダルMoEで、最大100万トークンのコンテキストに対応します。注目点はパラメータ数そのものではなく、HBMと外部ストレージの双方にまたがるキャッシュ使用量を抑える設計です。
主なポイント
- 事前計算とデコードで計算量を分ける。 Causal Encoder-Decoder(CED)アーキテクチャを採用し、事前計算では1トークン当たり8B、デコードでは16Bのパラメータを活性化します。長い入力を処理し、比較的短い応答を生成するエージェント向けの配分です。
- 層をまたいでKVを再利用する。 Compressed Sparse Attention 2(CSA2)における層間KVキャッシュ再利用と、FP4によるKVキャッシュを組み合わせます。常にHBMに置かれるグローバルKVキャッシュは、1トークン当たり890バイトで、DeepSeek-V4-Flashの約4分の1とされています。
- 永続キャッシュも別に最適化する。 SSDやホストメモリに置かれる永続KVキャッシュには、SWA Bounded Replayというデプロイメント最適化を適用します。論文の説明では、その使用量はDeepSeek-V4-Flashの約8分の1です。
- 圧縮だけを目的にしていない。 素材によれば、キャッシュを大幅に小さくしながら、ベースラインより優れた性能を示します。45Tトークンのマルチモーダルコーパスによる事前学習と、テキストおよびマルチモーダルなエージェント場面を対象にしたポストトレーニングも行われています。
意義と影響
この研究の意味は、単一のキャッシュを小さくしたことだけにありません。長文脈推論を、事前計算の負荷、HBMに常駐するKV状態、SSDやホストメモリに保存される状態という三つの問題として扱っている点が重要です。一つの層だけを最適化すると別の場所にボトルネックが移る可能性があります。CED、注意機構、低精度保存、デプロイメント戦略を組み合わせる設計は、モデルとシステムを一体で最適化する方向を示しています。
エージェント基盤にとって、キャッシュ容量と転送帯域は同時実行できるセッション数や、保持できる履歴量に関係します。報告された比率が実際のハードウェアとワークロードでも再現すれば、KVキャッシュ圧縮は長文脈サービスのコストを下げる有力な手段になり得ます。
一方、提供された素材には、具体的なハードウェア構成、レイテンシー、スループット、精度とのトレードオフ、タスク別の詳細比較は含まれていません。そのため、実際の運用効果を判断するには原論文の実験結果と個別のサービス条件を確認する必要があります。
コメント
ログイン状態を確認中…
コメントを読み込み中…