記事一覧へ戻る
大規模言語モデル

Dust:逆伝播を使わないTransformer事前学習への挑戦

読了目安 3 分

導入

現代の深層学習は、ほぼ一貫して逆伝播を中心に発展してきた。ネットワークの微分可能性を利用して勾配を計算し、オプティマイザーで重みを更新する仕組みである。Dustは、この前提を将来的に緩められるかを検討する研究だ。十分な計算資源があるなら、解析的な勾配よりも広い探索に基づく学習が競争力を持つ可能性がある。

Dustの仕組み

Dustはゼロ次最適化アルゴリズムであり、損失を解析的に微分しない。内部の活性値に摂動を加え、その結果として損失がどのように変化したかを測定する。損失を下げる方向の摂動に大きな報酬を与え、複数の摂動を重み付きで平均することで、更新方向を推定する。

特徴は、探索対象が重みではなく活性値である点だ。さらに、摂動を各トークンに独立して加えることで、各トークンを「仮想的な集団」の一員として扱う。同じフォワード計算の中で多数の候補を並列評価でき、候補ごとにモデルを複製して保存する必要がない。Transformerの層の種類ごとにトークン単位の報酬規則を変え、摂動したモジュール同士の干渉を抑える工夫も組み込まれている。

主なポイント

  • Transformer言語モデルの事前学習で、逆伝播に近い性能を示すゼロ次手法の一つだと報告されている。
  • 仮想集団を大きくすると、Dustの勾配推定は逆伝播の勾配とより整合する。複数の設定では逆伝播を上回ったという。
  • 重み空間で進化戦略を実行する方法に比べ、活性値空間の探索は評価とメモリの負担を抑えられる。論文の推定では、一定以上のトークン規模で、比較対象のEGGROLL実装より数桁効率的になり得る。
  • 大きなモデルほど集団を効率よく利用するケースがあり、ゼロ次手法はモデルの大型化で必ずしも不利になるとは限らない。
  • ただし、現時点で逆伝播を低コストに置き換えられるという主張ではない。著者らも、実用的な計算効率にはまだ達していないと位置づけている。

意義と限界

Dustの重要性は、すぐに新しい標準訓練法になることよりも、大規模ニューラルネットで試せる学習アルゴリズムの範囲を広げた点にある。活性値を探索すれば、内部表現や潜在的な推論過程を直接探索する方向も考えられる。また、外部プログラムや微分できない部品を含むシステムに、別の信用割当て方法を適用する余地も生まれる。

一方、逆伝播に近づくには大きな集団と追加の計算が必要になりやすい。今回の結果は実現可能性とスケーリングの傾向を示すものであり、コスト、データ効率、最終性能のすべてで逆伝播を上回ることを意味しない。今後は、さらに大きなモデルや、非微分可能な構成要素を本当に必要とするアーキテクチャで優位性が続くかが焦点になる。

出典:Hacker News

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
4Bモデルがチェスを指して解説する――Queenの設計と成果
大規模言語モデル
cctest.ai
大規模言語モデル

4Bモデルがチェスを指して解説する――Queenの設計と成果

Queenは、強いが説明をしないチェス専門エンコーダーと、自然言語を生成する指示チューニング済みモデルを組み合わせる。論文では、7回の反復蒸留によって棋力が1782から2697 Eloまで向上したと報告されている。

続きを読む
CCTest · Blog
Transformerは考えるのを早く止める?小さなLoRAが推論のリレーを再起動
大規模言語モデル
cctest.ai
大規模言語モデル

Transformerは考えるのを早く止める?小さなLoRAが推論のリレーを再起動

新たな研究は、多くの事前学習済みTransformerが長い参照連鎖を処理できないのではなく、計算を途中で止めている可能性を示した。初期層にrank-8 LoRAを加えるだけで、凍結された中間層がより長い連鎖を運べるようになる。

続きを読む