記事一覧へ戻る
メモリ・コンテキスト

xHC:Transformer の残差ストリームを N=16 へ拡張する試み

読了目安 3 分

導入

大規模言語モデルのスケーリングといえば、通常はパラメータ数、層数、幅、データ量、計算量が中心になります。xHC が注目するのは、Transformer の内部にある残差ストリームです。Hyper-Connections(HC)は、残差ストリームを N 本の並列ストリームへ拡張し、モデル内部の記憶容量を増やすような仕組みを提案してきました。しかし既存の HC 系手法は、多くの場合 N=4 付近で止まっていました。xHC は、この残差ストリーム幅をさらに大きくしても有効なのかを検証する研究です。

核心ポイント

  • N=4 までは有望だが、その先が難しい。 HC は N=1 から N=4 への拡張で大きな効果を示しており、残差ストリーム拡張が有望なスケーリング軸であることを示唆します。一方で、著者らの実験では mHC をさらに大きな N にすると、性能向上は鈍化し、訓練コストは急速に増えます。
  • 制約は主に二つあります。 一つは、ストリーム数が増えるほど、各ストリームへ十分な情報を書き戻すことが難しくなる点です。もう一つは、残差混合の生成コストが N に対して三次的に増える点です。
  • xHC は密に参照し、疎に更新します。 temporal feature augmentation により書き戻しに使う情報を増やしつつ、N=16 の残差ストリームのうち毎回 k=4 本だけを更新します。ただし、完全な残差状態への密なアクセスは維持されます。
  • 大規模 MoE で改善が報告されています。 18B MoE モデルでは、DeepSeek mHC と比べて最終訓練 loss を 1.776 から 1.758 に下げ、平均下流スコアを 44.8 から 48.8 に上げています。vanilla baseline に対する訓練 FLOPs の増加は 4.1% にとどまります。28B MoE でも、xHC は mHC を平均 3.1 ポイント上回りました。
  • メモリ効率も重視されています。 scaling-law 実験では、同じ loss に到達するために vanilla は xHC の 1.50 倍、mHC は 1.19 倍の計算量を必要とします。さらに xHC-Flash は、サブレイヤーあたりのメモリトラフィックを 73.5C から 40C に削減し、N=4 mHC の 34C に近づけています。

意義と影響

xHC の重要性は、単に残差ストリームを増やしたことではありません。mHC が N=4 を超えると効率を失う理由を整理し、その上で疎な更新という形で大きな N を扱いやすくした点にあります。これにより、残差ストリーム拡張は単なる構造上のアイデアではなく、大規模事前学習に使える可能性のある設計へ近づきました。

今後、他のモデル構成や訓練条件でも同様の結果が確認されれば、残差ストリーム幅は、深さ、幅、MoE の専門家数、データ規模に続く新たな拡張軸になるかもしれません。ただし現時点では、示されているのは論文内の実験結果です。外部再現、異なるモデルファミリーでの安定性、他の効率化手法との組み合わせは、今後の検証課題です。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
RecGPT-V3:推薦システムを「履歴の再生」から「記憶する意図理解」へ
メモリ・コンテキスト
cctest.ai

RecGPT-V3:推薦システムを「履歴の再生」から「記憶する意図理解」へ

RecGPT-V3 は、ユーザー記憶、Semantic IDs による商品 grounding、潜在トークンによる効率的推論を組み合わせた産業向け LLM 推薦システムです。淘宝の「Guess What You Like」フィードで、GMV +3.97% と serving リソース消費 52.4% 削減が報告されています。

続きを読む
CCTest · Blog
KV Cache を“接ぎ木”する:凍結小型モデルに検証済み知識を再利用させる手法
メモリ・コンテキスト
cctest.ai

KV Cache を“接ぎ木”する:凍結小型モデルに検証済み知識を再利用させる手法

新しい論文は、検証済みの知識をバイト単位で一致する KV Cache 状態として保存し、後の推論に接ぎ木する方法を提案している。繰り返し問題では大きな効率化を示す一方、再現性と能力向上の解釈には注意が必要だ。

続きを読む
CCTest · Blog
KV Cache 圧縮の落とし穴:構造トークンを残しすぎる推論バイアス
メモリ・コンテキスト
cctest.ai

KV Cache 圧縮の落とし穴:構造トークンを残しすぎる推論バイアス

arXiv の新論文は、注意重みに基づく KV Cache 退避が、ネストした JSON のような構造密度の高い入力で構造トークンを過剰に保持する可能性を示した。著者は、再学習なしで使えるロール条件付きの補正手法を提案している。

続きを読む