コードを見せなくても、モデルはコーディング能力を伝えられるのか
導入
コードを一度も見ていないモデルが、別のモデルからコーディング能力を学ぶことはできるのでしょうか。北京大学の研究は、慎重に設計された条件の下で、その可能性を示しました。ポイントは、後学習による変化が、目的タスクとは無関係に見える出力にも微弱な形で現れることです。
研究チームは「Active Taskless Distillation(ATD、能動的タスクレス蒸留)」を提案しました。教師モデルにプログラミング問題を解かせるのではなく、無関係な文脈で一般的な二つの単語からどちらを選ぶかを調べます。まず、教師と学生が共有するベースモデルが、二つの単語にほとんど差をつけないプロンプトを探します。その後、後学習済み教師が選んだ単語とプロンプトの組を、同じベースモデルから初期化した学生に学習させます。
主なポイント
- 教師の出力は単語一つだけです。 学生はコード、目的タスクの例、教師のパラメーター、完全なlogitsを受け取りません。
- ほぼ同率の判断を利用します。 ベースモデルが迷っている場所では、後学習による小さな確率変化が見えやすくなります。
- コーディング性能が向上しました。 Qwen2.5-1.5Bの主要実験では、5664組の単語レベルデータが、ノイズを厳密にそろえた対照群に比べてHumanEval+を5.34ポイント押し上げました。
- コードだけの現象ではありません。 科学知識、常識推論、読解でも転移が報告され、複数のモデル規模やモデル系列で観察されました。
- 変化には組み合わせ可能性があります。 機能分析では、学習された変化が他の能力と組み合わせられ、教師側の更新が強いほど転移も強くなる傾向が示されています。
意義と限界
この研究は、無関係な生成を通じて特性や好みが伝わるという、従来の「サブリミナル学習」の議論を能力の領域へ広げます。単一の単語が持つ情報は少なくても、意図的に集めた多数の選択は、モデル更新の方向を示す信号になり得ます。
開発者にとっては、後学習の評価を目的ベンチマークだけに限定せず、無関係なプロンプト上の変化も確認すべきだという示唆になります。安全性の観点では、タスクに見えない低帯域の出力を通じて能力が抽出・伝達される可能性も、今後検討すべき課題です。
一方、提供された素材だけでは、より大規模なモデルや異なる学習レシピ、敵対的な条件で同じ効果が安定するかは判断できません。ATDは、後学習が残す「行動の影」を調べる実験手法として理解するのが適切です。
コメント
ログイン状態を確認中…
コメントを読み込み中…