Transformerは考えるのを早く止める?小さなLoRAが推論のリレーを再起動
導入
Transformerの層数が多いからといって、すべてのタスクでその深さが十分に使われるとは限らない。Hugging Face Daily Papersで紹介された本研究は、思考過程を出力せず、答えだけを返す条件で、モデルが参照関係をどこまで追えるかを調べた。
例として、K = apple; B = K; D = B; print(D)というプログラムを考える。正答には、変数の親を順にたどる必要がある。0.6Bから32Bまでの13個の事前学習済みモデルを調べた結果、安定して追跡できるのは通常1.4〜3.6行だけだった。モデルを深くしたり、事前学習済みのループを増やしたりしても、到達範囲は大きく伸びなかった。
主な発見
- ごく小さなアダプターで実効的な深さが変わる。 Qwen3-8Bの初期層にrank-8 LoRAを置き、基盤モデルの重みをすべて凍結したところ、24行連鎖の完全一致率は15.5%から99%になった。追加されたパラメータは65,537個にすぎない。長く学習した版では、1回の前向き計算で50行まで処理できた。
- LoRAは計算のリレーを始める。 LoRAは各トークンに独立して作用し、トークン間の情報を直接運ぶわけではない。分析によれば、各行のチェーン上の識別情報が凍結された中間層、特に第16〜22層を通じて受け渡され、後段の注意ヘッドがより遠い祖先を読み取れるようになる。
- 挿入位置には急な境界がある。 第20層に適用した場合は約20.5行まで到達したが、第21層に移すと5.2行に低下した。凍結モデルを使った測定でも、保留した4モデルのうち3モデルで、有効な介入位置の限界を事前登録した許容範囲内に特定できた。
- ループ構造で効果を伸ばせる。 Ouro-1.4Bでは各ループにLoRAを適用すると、4ループで60行、8ループで少なくとも160行を処理した。これは2本のチェーンから選ぶ課題での結果である。
- 合成課題だけではない。 MuSiQueでは、3つの標準モデルに別々に学習した初期層LoRAを加えたところ、完全一致率が9.4〜17.9ポイント向上した。ただし、この評価では正解段落が与えられている。
意義と限界
本研究が示すのは、小さなアダプターが一般的な知能を突然追加するということではない。特定の課題では、事前学習モデルが有用な反復計算を表現できるのに、その開始や維持に失敗している可能性がある。LoRAは、その計算を起動するスイッチのように働き、凍結層が中間状態をより長く受け渡せるようにする。
この結果は、モデル改善の方向にも示唆を与える。全層を微調整したり、パラメータ数を増やしたりする前に、計算がどの層で止まるのかを測定し、狙った位置だけを編集できるからだ。一方、最良の結果は構造化された参照連鎖と管理された多段階QAで得られており、オープンドメインの推論能力を直接保証するものではない。モデル構造、課題、LoRAの位置に依存する点にも注意が必要だ。
コメント
ログイン状態を確認中…
コメントを読み込み中…