記事一覧へ戻る
推論・デプロイ

CRISP、構造を利用して長文脈の疎なプリフィルを改善

読了目安 3 分

導入

長文脈LLMの推論では、生成より前のプリフィル段階が大きなボトルネックになります。入力全体について自己注意を計算する必要があり、密な注意機構の計算量は文脈長に対して二次的に増加するためです。疎な注意機構は計算を削減できますが、固定パターンは入力ごとの違いに対応しにくく、オフラインのプロファイリングも未知のプロンプトでは十分とは限りません。CRISP(Cliff-awaRe Input-adaptive Sparse Prefilling)は、実行時に構造を判断する動的疎化を、より直接的かつ効率的にする研究です。

二つの中心的な変更

  • 構造から直接ルーティングする。 既存の動的方法では、プールした行列の積を計算し、Jensen-Shannon Divergence(JSD)によって注意ヘッドと疎なパターンの適合度を推定する場合があります。CRISPは、ルーティングの判断はプロキシ注意マップの構造自体から読み取れると考えます。提案するC_structは、Vertical-Slashパターンと互換性のある位置にどれだけ質量があるかを測定します。論文によれば、JSDに近いルーティング判断を再現しながら、プール後の行列積とKLダイバージェンス計算を省けます。

  • sinkとノイズを考慮して閾値を決める。 softmax後の注意質量には、少数の位置が大きな質量を持ち、その後に小さな値が長く続く「質量の崖」が現れます。累積質量を一定割合まで満たす単純な方式では、文脈が長くなるほど背景部分がO(n)規模で選択対象に加わり、情報量に見合わない計算を招きます。CRISPはノイズフロアを基準にしたsink-aware thresholdを使い、重要な構造を残しながら背景の累積を抑えます。

結果と影響

提供された内容では、二つのモデル系列を用いたInfiniteBench、RULER、LongBenchで、CRISPは総合的に最も強い疎な手法と報告されています。検索負荷の高いタスクでは、密な正確注意に匹敵、またはそれを上回り、ベースラインから最大28.0ポイントを回復しました。512kトークンでは、注意計算について最大5.30倍の高速化が示されています。主な要因は、選択時のO(n)背景ノイズを除きつつ、注意構造を維持したことだと説明されています。

この研究が示す重要な点は、動的疎化の課題が、単にどのパターンを選ぶかだけではないことです。ルーティングの判断そのものにもコストがあり、選択数を決める累積質量のルールも超長文脈では不安定になり得ます。CRISPはこの二つを、構造的な代理指標とsinkを考慮した閾値で同時に扱います。ただし、提供された素材だけでは、すべてのモデル構造、ハードウェア、疎なパターンへの一般化までは判断できません。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
言語モデルが自分で見る場所を決める:Declarative Attention
推論・デプロイ
cctest.ai
推論・デプロイ

言語モデルが自分で見る場所を決める:Declarative Attention

Declarative Attentionは、長いコンテキストのどの領域が必要かをモデル自身に宣言させ、KVキャッシュの読み出しを省く仕組みです。評価では大幅な読み出し削減が示された一方、精度には小さな低下が生じました。

続きを読む
CCTest · Blog
検証を予測する草稿モデルへ:VATが投機的デコードを改善
推論・デプロイ
cctest.ai
推論・デプロイ

検証を予測する草稿モデルへ:VATが投機的デコードを改善

NAVER AI Labは、投機的デコードの逐次検証を草稿モデルの学習に組み込むVerification-Aware Training(VAT)を提案した。モデル構造や推論手順を変更せず、受理されるトークン列の長さと実測速度の改善を狙う。

続きを読む
CCTest · Blog
MiniMax H3のリアルタイム配信に必要なのはDiTの高速化だけではない
推論・デプロイ
cctest.ai
推論・デプロイ

MiniMax H3のリアルタイム配信に必要なのはDiTの高速化だけではない

vLLM-Omniは、MiniMax H3をエンコーダーからMP4生成までのシステム全体として最適化した。さらにFastVideoのFastH3を組み合わせ、DiTの前向き計算を4回に削減することで、完全な応答を再生時間に近づけている。

続きを読む