長文脈ハイブリッドモデルでは位置バイアスが鍵になる
大規模言語モデルの長文脈化では、すべてのトークンを相互接続する全注意だけでなく、複数の注意機構を組み合わせる設計が広がっている。全注意は遠距離依存を捉えやすい一方、系列が長くなるほど計算負荷が増える。スライディングウィンドウ注意は参照範囲を局所化し、線形注意は履歴をよりコンパクトに集約することを目指す。
論文「Mechanics of Long-Context Hybrid Models Part 1.1」は、RoPE全注意、NoPE全注意、スライディングウィンドウ注意、GLAやGDNなどのゲート付き線形注意が、長文脈の学習中にどのように協調するかを分析した。重要なのは、ハイブリッドモデルを単なる注意機構の混合として見るのではなく、それぞれが持つ位置に関する帰納バイアスの組み合わせとして理解することだという。
文脈拡張と長さ外挿のシーソー効果
研究では、スライディングウィンドウ型と線形注意型で、得意な条件が逆転する現象が観測された。訓練時の文脈長を超えてそのまま利用する長さ外挿では、スライディングウィンドウ型が強い。一方、長い系列を使った継続事前学習を行うと、線形注意型がより大きな恩恵を受ける。層ごとに機構を配置する構成では、この違いが特に明確だった。
スライディングウィンドウ型について、著者らは「短文脈学習の罠」を指摘する。短いウィンドウに適応しすぎると、後から文脈を広げても遠距離情報を十分に利用できない可能性がある。さらに、短すぎるウィンドウが長文脈学習を阻む「短ウィンドウ疲れ」と、長すぎるウィンドウが局所構造の学習を弱める「長ウィンドウの怠慢」という傾向も整理されている。
線形注意にも外挿の無料チケットはない
線形注意は訓練範囲内や長文脈の継続学習後には良好な性能を示すが、訓練長を直接超える外挿ではスライディングウィンドウ型に及ばないことがある。計算量が小さいことだけで、位置の一般化能力まで保証されるわけではない。
また、NoPE注意の一部は高い検索ヒット率と粗いグローバル集約によって広い情報アクセスを担い、RoPE注意やゲート付き線形注意のような低エントロピーの位置依存機構はノイズの削減を担う、という役割分担も示された。両者の境界は混合比率によって変化するため、特定機構を増やせばよいとは限らない。
局所性と外挿をつなぐ提案
著者らは、位置に敏感な注意へスライディングウィンドウを導入し、NoPE注意のグローバル集約を強化するSliding-Window Linear Attentionを提案した。局所的な構造、全体検索、長さ外挿を同時に扱うことが狙いである。報告では、64K文脈のNIAH-SK1で100%の精度を維持し、学習なしで16倍の長さ外挿を達成した。
この研究が示すのは、長文脈モデルの設計では計算量だけでなく、ウィンドウ幅、層ごとの配置、位置符号化、局所経路と全体経路の比率を同時に考える必要があるということだ。異なる注意機構を組み合わせるだけでなく、それらが生む位置バイアスまで共同設計することが、次のハイブリッドモデルに求められる。
コメント
ログイン状態を確認中…
コメントを読み込み中…