記事一覧へ戻る
大規模言語モデル

Transformerは考えるのを早く止める?小さなLoRAが推論のリレーを再起動

読了目安 3 分

導入

Transformerの層数が多いからといって、すべてのタスクでその深さが十分に使われるとは限らない。Hugging Face Daily Papersで紹介された本研究は、思考過程を出力せず、答えだけを返す条件で、モデルが参照関係をどこまで追えるかを調べた。

例として、K = apple; B = K; D = B; print(D)というプログラムを考える。正答には、変数の親を順にたどる必要がある。0.6Bから32Bまでの13個の事前学習済みモデルを調べた結果、安定して追跡できるのは通常1.4〜3.6行だけだった。モデルを深くしたり、事前学習済みのループを増やしたりしても、到達範囲は大きく伸びなかった。

主な発見

  • ごく小さなアダプターで実効的な深さが変わる。 Qwen3-8Bの初期層にrank-8 LoRAを置き、基盤モデルの重みをすべて凍結したところ、24行連鎖の完全一致率は15.5%から99%になった。追加されたパラメータは65,537個にすぎない。長く学習した版では、1回の前向き計算で50行まで処理できた。
  • LoRAは計算のリレーを始める。 LoRAは各トークンに独立して作用し、トークン間の情報を直接運ぶわけではない。分析によれば、各行のチェーン上の識別情報が凍結された中間層、特に第16〜22層を通じて受け渡され、後段の注意ヘッドがより遠い祖先を読み取れるようになる。
  • 挿入位置には急な境界がある。 第20層に適用した場合は約20.5行まで到達したが、第21層に移すと5.2行に低下した。凍結モデルを使った測定でも、保留した4モデルのうち3モデルで、有効な介入位置の限界を事前登録した許容範囲内に特定できた。
  • ループ構造で効果を伸ばせる。 Ouro-1.4Bでは各ループにLoRAを適用すると、4ループで60行、8ループで少なくとも160行を処理した。これは2本のチェーンから選ぶ課題での結果である。
  • 合成課題だけではない。 MuSiQueでは、3つの標準モデルに別々に学習した初期層LoRAを加えたところ、完全一致率が9.4〜17.9ポイント向上した。ただし、この評価では正解段落が与えられている。

意義と限界

本研究が示すのは、小さなアダプターが一般的な知能を突然追加するということではない。特定の課題では、事前学習モデルが有用な反復計算を表現できるのに、その開始や維持に失敗している可能性がある。LoRAは、その計算を起動するスイッチのように働き、凍結層が中間状態をより長く受け渡せるようにする。

この結果は、モデル改善の方向にも示唆を与える。全層を微調整したり、パラメータ数を増やしたりする前に、計算がどの層で止まるのかを測定し、狙った位置だけを編集できるからだ。一方、最良の結果は構造化された参照連鎖と管理された多段階QAで得られており、オープンドメインの推論能力を直接保証するものではない。モデル構造、課題、LoRAの位置に依存する点にも注意が必要だ。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
コードを見せなくても、モデルはコーディング能力を伝えられるのか
大規模言語モデル
cctest.ai
大規模言語モデル

コードを見せなくても、モデルはコーディング能力を伝えられるのか

北京大学の研究は、後学習済みモデルが無関係なプロンプトに返す単語一つだけでも、別のモデルへ能力の一部を伝えられる可能性を示した。研究者はこの微細な変化を「行動の影」と呼ぶ。

続きを読む
CCTest · Blog
正解をまねるのではなく、誤った推論を避けてLLMを学習させる
大規模言語モデル
cctest.ai
大規模言語モデル

正解をまねるのではなく、誤った推論を避けてLLMを学習させる

Negative Self-Distillationは、特権情報を使った正解軌跡をそのまま模倣させるのではなく、モデル自身が生成した不完全な推論から離れるように学習する枠組みです。外部ラベルなしで探索と自己修正を保つことを目指します。

続きを読む