分割KVキャッシュ圧縮が生む周期的な検索の弱点
長文脈モデルでは、情報がプロンプト内に存在していれば、どの位置にあっても同じように取り出せると考えがちです。しかし、分割型KVキャッシュ圧縮を使うモデルでは、この前提が崩れる可能性があります。連続するトークンを少数のキャッシュエントリにまとめると、同じ内容でも圧縮ウィンドウの境界から見た位置によって、検索のしやすさが変化します。
圧縮が生む「位相」
例えば、8トークンのウィンドウを4トークン間隔で圧縮する場合、各トークンにはストライドを基準とした位相が生じます。プロンプトの先頭に無関係なトークンを1つ加えると、本文の内容や順序は変わりませんが、後続トークンの位相だけがずれます。それでも出力が変化するなら、原因は入力データではなく、モデルの圧縮方式にあると考えられます。
研究ではDeepSeek-V4-Flash-Baseを使い、同じFP8カーネルのコード補完を調べました。コード自体は変更せず、関係のないdocstringを少しずつ長くしたところ、モデルの上位予測が正解の8と32の間で、約4トークン周期に切り替わりました。分割圧縮を使わない比較モデルでは、同じ規則的な偏りは確認されませんでした。
平均値が隠す大きな差
ニードル・イン・ア・ヘイスタック型の評価では、クエリ位置、対象位置の統計、レコード数をそろえ、対象情報の位相だけを変えました。DeepSeek-V4の複数モデルでは、精度が圧縮ストライドに合わせて上下し、最良と最悪の位相の差はおよそ15~40ポイントに達しました。追加学習によって全体精度は上がり差も縮まりましたが、周期的な傾向は残りました。
この現象は特定モデル固有の偶然でもありません。研究者は小型Transformerをゼロから学習し、全注意機構との主な違いを分割圧縮に限定しました。ウィンドウ幅、ストライド、KVヘッド数、ゲート、位置エンコーディングを変えても、周期はおおむねストライドに追従しました。制御実験では、圧縮モデルの平均精度が全注意モデルに近い一方、最悪位置の精度が大きく落ちる場合があり、差は最大78ポイントに達しました。
注意ヘッドの位相分業
因果介入からは、注意ヘッドが周期全体に均等に働くのではなく、特定の位相に専門化していることが示されました。あるヘッドは隣接する数位相で重要になり、別のヘッドが他の位相を担います。圧縮ゲートも各ウィンドウで似たスロットを選びやすく、キーと値の選択には一定のずれがあるため、隣接トークンがまとめて保持されやすくなります。
ゲートのパラメータだけを循環移動すると、弱点の位置も一緒に移動しました。これは、周期的な失敗が圧縮レイアウトと直接結び付いていることを示します。理想化モデルの分析では、勾配学習が各ヘッドを固定スロットへ集中させやすい一方、全位相を均等にカバーする動機は十分でない可能性も示されています。
評価方法への示唆
圧縮はキャッシュメモリと注意計算を削減できるため、長文脈推論に有用です。ただし、平均精度だけで安全性や安定性を判断するのは不十分です。今後は位相別精度、最良と最悪の差、ウィンドウ幅やストライドを変えたときの頑健性を併記する必要があります。
コード補完、文書QA、検索拡張生成では、無関係な接頭辞の追加が対象情報の位相を変え、回答を左右する可能性があります。高い平均値の裏に、予測可能な周期的弱点が隠れている点が、この研究の重要な警告です。
コメント
ログイン状態を確認中…
コメントを読み込み中…