学習なしでアーキテクチャの潜在力を測るNSC、仕様だけで設計を最適化
導入
Transformerの設計やモデル圧縮では、限られた予算をどこに配分するかが中心的な課題になります。層を深くするのか、隠れ次元を広げるのか、注意ヘッドを増やすのか、それともFFNを大きくするのか。パラメータ数とFLOPsは広く使われる指標ですが、モデルの大きさと計算量を示すだけで、同じ予算がどのような構造に配分されたかを十分には表せません。
《Neural Spectral Capacity: Measuring and Designing Architectures from Network Specification Alone》は、この問題に対してNSCという構造を意識した指標を提案します。
仕組み
NSCの基礎にあるのは、各重み行列の特異値スペクトルです。標準的なランダム初期化を仮定すると、Marchenko–Pastur則によって、行列の形状と初期化分散からスペクトルの性質を理論的に記述できます。著者らはこの関係を利用し、アーキテクチャの仕様だけから閉形式の容量スコアを求めます。
したがって、候補モデルを実際に構築する必要がなく、データ、勾配、学習も不要です。大規模な候補群を一つずつ訓練する前に、構造上の潜在力を比較できる点が特徴です。
さらに、NSCは層ごとの寄与を足し合わせられます。これを利用したNSC-DPは、パラメータ数またはFLOPsの制約を持つアーキテクチャ選択を動的計画法に変換します。ブラックボックス型の探索とは異なり、設定された探索空間の中でNSCを最大化する解を大域的に求められます。
実験で示されたこと
- FlexiBERTの順位付けでは、NSCはパラメータ数や代表的な学習不要プロキシより高い性能を示しました。パラメータ数の差が10%未満のモデル同士でも、NSCは順位付けの情報を保ちました。
- WikiText-103のTransformer-XL設計では、CPU上で約2秒で探索を完了し、論文中の人手設計ベースラインより低い困惑度の構成を見つけました。
- LLaMA-7Bの剪定では、キャリブレーションデータを使わずに5.7Bモデルを選択し、8つの常識推論タスクで最良の総合結果を報告しました。最強の学習不要プロキシと比べ、実行速度は約5900倍でした。
意義と限界
NSCの重要性は、新しい評価指標を提案したことだけではありません。仕様だけで計算でき、しかも層ごとに分解できるスコアを持つことで、アーキテクチャ評価と探索を一つの最適化問題として扱えるようになります。モデル設計や圧縮の初期候補を高速に絞り込む用途に向いています。
一方、NSCはランダム初期化とスペクトル理論に基づく構造的な容量の指標です。特定タスクでの精度を常に保証するものではありません。データ分布、学習ダイナミクス、最適化手法、ハードウェア制約などは最終結果に影響します。今後は、NSCの速度と加法性を保ったまま、データ依存の信号や実運用コストを組み合わせられるかが焦点になります。
コメント
ログイン状態を確認中…
コメントを読み込み中…