記事一覧へ戻る
大規模言語モデル

Loop Scaling Laws、循環型MoEの拡張則を統合

読了目安 3 分

導入

大規模言語モデルの拡張は、固有パラメータを増やすことだけではありません。循環型Transformerは同じパラメータを複数回利用し、保存するパラメータ数を大きく増やさずに計算の深さを高めます。一方、Mixture-of-Experts(MoE)はトークンごとに一部の専門家だけを選ぶことで、アクティブな計算量を抑えながら総容量を拡大します。

これまでのスケーリング則は、循環と疎性を別々に扱うことが一般的でした。そのため、MoEに循環を加えたとき、何回ループさせるべきか、また疎性がループの価値をどのように変えるのかは明確ではありませんでした。

Metaの研究チームは論文「Scaling Laws for Looped Mixture of Experts」で、循環、疎性、モデル規模、データ量を統合的に扱うLoop Scaling Lawsを提案しています。

主なポイント

  • 循環と疎性を一つの枠組みで扱う。 循環は計算深度を、MoEの疎性は総パラメータ容量を主に増やすという違いを同時にモデル化します。
  • ループ数ではなく実効容量を見る。 疎性に条件づけられた有界の循環写像により、循環がもたらす実質的な容量増加と、効果が飽和する過程を表します。
  • 既存の拡張則と接続する。 特定の条件では、通常の密モデルおよびMoEのスケーリング則を特殊例として再現します。
  • 制約下の設計に使える。 学習計算量やメモリ上限を前提に、モデル規模、疎性、循環回数を選ぶための基盤になります。
  • 異なる効率軸が補完し合う。 概要によれば、疎性はアクティブパラメータ効率で約3倍、循環は推論タスクの総パラメータ効率で約2倍の効果を示し、組み合わせると性能フロンティアをさらに押し上げました。

意義と影響

この研究の重要性は、新しい式を提示したことだけではありません。モデルの「容量」と「深さ」を同じ設計空間で考えられるようにした点にあります。専門家数を増やすMoEは総容量を広げますが、各トークンで全パラメータを計算するわけではありません。循環は同じブロックを繰り返し実行することで深い計算を可能にしますが、ループを増やせば無限に改善するとは限りません。飽和を含む拡張則は、経験だけに頼らない構成選択に役立ちます。

概要では、1兆トークン規模の学習でも効果が確認されたとされています。学習計算量をそろえた場合、法則から選んだ循環を備えるMoEが、総パラメータ数で約2倍の非循環MoEに近い推論ベンチマーク性能を示したという報告です。また、推論時に追加のループを実行することで、テスト時スケーリングにもつながります。

ただし、これらは報告された条件での結果であり、すべてのモデルに同じ倍率が保証されるわけではありません。タスク、ルーティング、ハードウェア利用率、最適化の安定性などが実際の効果を左右します。それでも、パラメータ数だけでなく、アクティブ計算量、反復深度、推論時予算を一体で配分する方向性を示す研究だと言えます。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
コードを見せなくても、モデルはコーディング能力を伝えられるのか
大規模言語モデル
cctest.ai
大規模言語モデル

コードを見せなくても、モデルはコーディング能力を伝えられるのか

北京大学の研究は、後学習済みモデルが無関係なプロンプトに返す単語一つだけでも、別のモデルへ能力の一部を伝えられる可能性を示した。研究者はこの微細な変化を「行動の影」と呼ぶ。

続きを読む
CCTest · Blog
正解をまねるのではなく、誤った推論を避けてLLMを学習させる
大規模言語モデル
cctest.ai
大規模言語モデル

正解をまねるのではなく、誤った推論を避けてLLMを学習させる

Negative Self-Distillationは、特権情報を使った正解軌跡をそのまま模倣させるのではなく、モデル自身が生成した不完全な推論から離れるように学習する枠組みです。外部ラベルなしで探索と自己修正を保つことを目指します。

続きを読む
CCTest · Blog
NCP-ArchPreview:次のトークンから次の概念を予測する言語モデルへ
大規模言語モデル
cctest.ai
大規模言語モデル

NCP-ArchPreview:次のトークンから次の概念を予測する言語モデルへ

NCP-ArchPreviewは、従来の次トークン予測に、複数トークンをまたぐ離散的な「次の概念」予測を組み合わせる。自動回帰生成を維持しながら、潜在空間でより高い抽象度の学習を試みる構成だ。

続きを読む