記事一覧へ戻る
メモリ・コンテキスト

長文脈ハイブリッドモデルでは位置バイアスが鍵になる

読了目安 3 分

大規模言語モデルの長文脈化では、すべてのトークンを相互接続する全注意だけでなく、複数の注意機構を組み合わせる設計が広がっている。全注意は遠距離依存を捉えやすい一方、系列が長くなるほど計算負荷が増える。スライディングウィンドウ注意は参照範囲を局所化し、線形注意は履歴をよりコンパクトに集約することを目指す。

論文「Mechanics of Long-Context Hybrid Models Part 1.1」は、RoPE全注意、NoPE全注意、スライディングウィンドウ注意、GLAやGDNなどのゲート付き線形注意が、長文脈の学習中にどのように協調するかを分析した。重要なのは、ハイブリッドモデルを単なる注意機構の混合として見るのではなく、それぞれが持つ位置に関する帰納バイアスの組み合わせとして理解することだという。

文脈拡張と長さ外挿のシーソー効果

研究では、スライディングウィンドウ型と線形注意型で、得意な条件が逆転する現象が観測された。訓練時の文脈長を超えてそのまま利用する長さ外挿では、スライディングウィンドウ型が強い。一方、長い系列を使った継続事前学習を行うと、線形注意型がより大きな恩恵を受ける。層ごとに機構を配置する構成では、この違いが特に明確だった。

スライディングウィンドウ型について、著者らは「短文脈学習の罠」を指摘する。短いウィンドウに適応しすぎると、後から文脈を広げても遠距離情報を十分に利用できない可能性がある。さらに、短すぎるウィンドウが長文脈学習を阻む「短ウィンドウ疲れ」と、長すぎるウィンドウが局所構造の学習を弱める「長ウィンドウの怠慢」という傾向も整理されている。

線形注意にも外挿の無料チケットはない

線形注意は訓練範囲内や長文脈の継続学習後には良好な性能を示すが、訓練長を直接超える外挿ではスライディングウィンドウ型に及ばないことがある。計算量が小さいことだけで、位置の一般化能力まで保証されるわけではない。

また、NoPE注意の一部は高い検索ヒット率と粗いグローバル集約によって広い情報アクセスを担い、RoPE注意やゲート付き線形注意のような低エントロピーの位置依存機構はノイズの削減を担う、という役割分担も示された。両者の境界は混合比率によって変化するため、特定機構を増やせばよいとは限らない。

局所性と外挿をつなぐ提案

著者らは、位置に敏感な注意へスライディングウィンドウを導入し、NoPE注意のグローバル集約を強化するSliding-Window Linear Attentionを提案した。局所的な構造、全体検索、長さ外挿を同時に扱うことが狙いである。報告では、64K文脈のNIAH-SK1で100%の精度を維持し、学習なしで16倍の長さ外挿を達成した。

この研究が示すのは、長文脈モデルの設計では計算量だけでなく、ウィンドウ幅、層ごとの配置、位置符号化、局所経路と全体経路の比率を同時に考える必要があるということだ。異なる注意機構を組み合わせるだけでなく、それらが生む位置バイアスまで共同設計することが、次のハイブリッドモデルに求められる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
EngramEdit、LLMの事実知識を独立して更新可能に
メモリ・コンテキスト
cctest.ai

EngramEdit、LLMの事実知識を独立して更新可能に

EngramEditは、条件付きメモリを単なる容量拡張の仕組みから、編集可能な知識インターフェースへと発展させる手法です。Transformer本体を固定したまま共有n-gram埋め込みを更新し、表現の違いをまたぐ知識編集と副作用の抑制を目指します。

続きを読む
CCTest · Blog
AIに5000万トークンの再利用可能な記憶を与えるKV状態の永続化
メモリ・コンテキスト
cctest.ai

AIに5000万トークンの再利用可能な記憶を与えるKV状態の永続化

galahad-kvを使った実験では、言語モデルのKV状態を暗号化したローカルNVMeに保存し、再計算なしで後から読み戻せることが示された。注意ウィンドウを拡大する技術ではないが、長い履歴を効率的に再利用する方法になる。

続きを読む
CCTest · Blog
MemAdapter:反実仮想適応で長期記憶による迎合を抑える
メモリ・コンテキスト
cctest.ai

MemAdapter:反実仮想適応で長期記憶による迎合を抑える

長期記憶はLLMエージェントの個人化を高める一方、ユーザーの過去の考えに過度に同調させることがあります。MemAdapterは、現在の文脈に応じて記憶の影響度を動的に調整します。

続きを読む