CRISP、構造を利用して長文脈の疎なプリフィルを改善
導入
長文脈LLMの推論では、生成より前のプリフィル段階が大きなボトルネックになります。入力全体について自己注意を計算する必要があり、密な注意機構の計算量は文脈長に対して二次的に増加するためです。疎な注意機構は計算を削減できますが、固定パターンは入力ごとの違いに対応しにくく、オフラインのプロファイリングも未知のプロンプトでは十分とは限りません。CRISP(Cliff-awaRe Input-adaptive Sparse Prefilling)は、実行時に構造を判断する動的疎化を、より直接的かつ効率的にする研究です。
二つの中心的な変更
-
構造から直接ルーティングする。 既存の動的方法では、プールした行列の積を計算し、Jensen-Shannon Divergence(JSD)によって注意ヘッドと疎なパターンの適合度を推定する場合があります。CRISPは、ルーティングの判断はプロキシ注意マップの構造自体から読み取れると考えます。提案するC_structは、Vertical-Slashパターンと互換性のある位置にどれだけ質量があるかを測定します。論文によれば、JSDに近いルーティング判断を再現しながら、プール後の行列積とKLダイバージェンス計算を省けます。
-
sinkとノイズを考慮して閾値を決める。 softmax後の注意質量には、少数の位置が大きな質量を持ち、その後に小さな値が長く続く「質量の崖」が現れます。累積質量を一定割合まで満たす単純な方式では、文脈が長くなるほど背景部分がO(n)規模で選択対象に加わり、情報量に見合わない計算を招きます。CRISPはノイズフロアを基準にしたsink-aware thresholdを使い、重要な構造を残しながら背景の累積を抑えます。
結果と影響
提供された内容では、二つのモデル系列を用いたInfiniteBench、RULER、LongBenchで、CRISPは総合的に最も強い疎な手法と報告されています。検索負荷の高いタスクでは、密な正確注意に匹敵、またはそれを上回り、ベースラインから最大28.0ポイントを回復しました。512kトークンでは、注意計算について最大5.30倍の高速化が示されています。主な要因は、選択時のO(n)背景ノイズを除きつつ、注意構造を維持したことだと説明されています。
この研究が示す重要な点は、動的疎化の課題が、単にどのパターンを選ぶかだけではないことです。ルーティングの判断そのものにもコストがあり、選択数を決める累積質量のルールも超長文脈では不安定になり得ます。CRISPはこの二つを、構造的な代理指標とsinkを考慮した閾値で同時に扱います。ただし、提供された素材だけでは、すべてのモデル構造、ハードウェア、疎なパターンへの一般化までは判断できません。
コメント
ログイン状態を確認中…
コメントを読み込み中…