記事一覧へ戻る
モデル評価

学習の痕跡を残す残差構造:言語モデルの系譜を重みから検証

読了目安 3 分

導入

オープンウェイトの言語モデルは、公開後も微調整、LoRAのマージ、剪定、量子化、さらに別モデルとの統合を経ることが多い。こうした派生は実用上重要だが、モデルカードや学習記録が不完全な場合、どのモデルから生まれたのかを追跡するのは難しい。

論文「Training Leaves Traces」は、より限定された、しかし実務的な問いを扱う。学習データ、入力プロンプト、訓練ログを見ずに、互換性のある二つのチェックポイントが共通の祖先を持つかを、重みそのものから判定できるのかという問いだ。著者らはこれを、データフリーのホワイトボックス系譜検証として定式化した。

共有成分をそのまま使わない

残差構造には注意すべき特徴がある。残差分岐に関係する積の中には、モデルのアイデンティティと整列した共有成分が現れる。しかしこれは複数のモデルに共通して存在し得るため、それだけでは血統の証拠にならない。共有された構造を、誤って学習の継承と解釈する危険があるからだ。

提案手法は、次のようにこの問題を扱う。

  • 残差関連の積から、共有されたアイデンティティ整列成分を取り除く。
  • 複数の残差ブロックに残る、チェックポイント固有の構造を比較する。
  • 独立したチェックポイントを基準にスコアを校正し、対称的な系譜スコアを作る。

ここで見ているのは、出力の似ている度合いではなく、学習によって重みに残った構造的な痕跡である。したがって、動作が似ているだけの独立モデルと、実際に派生したモデルを区別できる可能性がある。

実験結果

残差MLPとGPT-2のベンチマークでは、微調整、LoRAマージ、剪定、量子化で作られた派生モデルを、独立モデルや蒸留モデルから分離できた。報告された設定ではAUROC 1.0に達している。ただし、これは対象となったベンチマークにおける結果であり、あらゆるアーキテクチャや改変方法に対する保証ではない。

さらに、モデルの機能を保ったままチェックポイントを改変する「洗浄」実験も行った。従来の重み空間ベースラインは識別余地を失ったり、判定に失敗したりした一方、提案スコアは変化しなかった。GPT-2では、最も近い堅牢なベースラインの76倍高速だった。投影ペアリングの信号は六つの言語モデルファミリーとその外部でも確認され、公開LLaMA-2チェックポイントの事例では、関連する3件と無関係な7件を正しく識別した。

意義と限界

この技術は、オープンモデルの来歴監査に新しい層を加える。非公開データや再学習を必要とせず、リポジトリ上の派生関係や、未記載の系譜を調べる手がかりを提供できるためだ。出力の安全性や性能を調べる評価とは異なり、重みがどこから来たかに焦点を当てる点も特徴である。

一方で、完全なプロヴナンス復元ではない。互換性のあるチェックポイント、残差構造、独立モデルによる校正に依存し、変換の全履歴を再構成するものでもない。実運用では、モデルカード、学習ログ、署名付きリリースと組み合わせて使うのが適切だろう。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
HyperBrowseComp、多言語・マルチモーダルなウェブ閲覧能力を試す
モデル評価
cctest.ai
モデル評価

HyperBrowseComp、多言語・マルチモーダルなウェブ閲覧能力を試す

HyperBrowseCompは、ウェブ閲覧エージェントを対象にした高難度の評価ベンチマークです。13言語と複数の証拠形式を対象に、検索結果を読むだけでなく、分散した手がかりを発見し、つなぎ合わせ、検証する能力を測ります。

続きを読む
CCTest · Blog
モデルの挙動からデータの来歴へ:合成事前学習で帰属を検証
モデル評価
cctest.ai
モデル評価

モデルの挙動からデータの来歴へ:合成事前学習で帰属を検証

データの来歴を記録した合成タスクを使い、表形式基盤モデルの挙動に本当に影響した事前学習データを検証する研究が発表された。結果は、介入による因果的な寄与と、データの来歴上の類似性は同じではないことも示している。

続きを読む