記事一覧へ戻る
大規模言語モデル

Skaling Law:モデル規模とデータ量を再び結び直す新しいスケーリング則

読了目安 3 分

導入

大規模言語モデルの開発では、実際に巨大な計算資源を投入する前に、どの程度のモデルサイズとデータ量を選ぶべきかを見積もる必要があります。そのために使われてきたのがニューラルスケーリング則です。Hugging Face Daily Papers に掲載された「Skaling: Chinchilla's Exponents Meet Kaplan's Coupling」は、この予測式が特定の領域で不安定になる原因に焦点を当てています。

主要ポイント

  • 独立性の仮定が限界になる。 従来の定式化では、モデルサイズと学習データ量が損失に与える影響をほぼ別々に扱います。論文は、この仮定がデータが少ない場合や、通常より長く学習する場合に、損失の過小評価または過大評価を生むと指摘しています。
  • Skaling law は相互作用を入れる。 提案手法は、モデル容量とデータ量を単一の相互作用指数で結合します。つまり、パラメータ数とトークン数を個別に見るだけでなく、その組み合わせが損失にどう影響するかを式の中に取り込みます。
  • 予測誤差を低減。 要旨によると、Skaling law は補間と外挿の両方で平均絶対パーセント誤差(MAPE)を 1.5〜3 倍削減します。既に試した範囲だけでなく、より大きな設定を予測する用途で重要な改善です。
  • 少ない実験で広い範囲を推定。 さらに、低計算量領域に限定した疎なグリッド戦略と組み合わせることで、一様なスイープに比べて約 10 分の 1 の計算で全体グリッドを外挿できるとされています。

意義と影響

この研究の実務的な価値は、事前実験の費用を抑えながら大規模学習の結果をより信頼して見積もれる点にあります。モデル開発チームは、小規模な実験から得た情報を使って、より大きな訓練計画のモデルサイズ、データ量、計算予算を選びやすくなります。

同時に、この論文はスケーリング則を固定的な経験則として扱う危うさも示しています。学習条件がデータ不足、長時間学習、非標準的な配分へ広がるほど、モデル容量とデータ量の相互作用は無視しにくくなります。Skaling law は式の単純さを大きく損なわずに、その相互作用を取り込む試みです。

今後の焦点は、この法則が異なるモデルファミリー、データセット、学習設定でも同じように有効かどうかです。それでも、次世代モデルの計算予算を設計するうえで、より堅牢で資源効率の高い予測枠組みとして注目に値します。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
NCP-ArchPreview:次のトークンから次の概念を予測する言語モデルへ
大規模言語モデル
cctest.ai
大規模言語モデル

NCP-ArchPreview:次のトークンから次の概念を予測する言語モデルへ

NCP-ArchPreviewは、従来の次トークン予測に、複数トークンをまたぐ離散的な「次の概念」予測を組み合わせる。自動回帰生成を維持しながら、潜在空間でより高い抽象度の学習を試みる構成だ。

続きを読む
CCTest · Blog
正解をまねるのではなく、誤った推論を避けてLLMを学習させる
大規模言語モデル
cctest.ai
大規模言語モデル

正解をまねるのではなく、誤った推論を避けてLLMを学習させる

Negative Self-Distillationは、特権情報を使った正解軌跡をそのまま模倣させるのではなく、モデル自身が生成した不完全な推論から離れるように学習する枠組みです。外部ラベルなしで探索と自己修正を保つことを目指します。

続きを読む
CCTest · Blog
多言語データの混合で、モデルは入力言語のまま推論できるか
大規模言語モデル
cctest.ai
大規模言語モデル

多言語データの混合で、モデルは入力言語のまま推論できるか

Cohere Labs は、推論モデルが英語に戻らず、ユーザーの入力言語で考えるための学習方法を検証した。3.35B パラメータの Tiny Aya L2-Thinker は、60言語で93%以上の言語内推論率を報告している。

続きを読む