記事一覧へ戻る
大規模言語モデル

コードを見せなくても、モデルはコーディング能力を伝えられるのか

読了目安 3 分

導入

コードを一度も見ていないモデルが、別のモデルからコーディング能力を学ぶことはできるのでしょうか。北京大学の研究は、慎重に設計された条件の下で、その可能性を示しました。ポイントは、後学習による変化が、目的タスクとは無関係に見える出力にも微弱な形で現れることです。

研究チームは「Active Taskless Distillation(ATD、能動的タスクレス蒸留)」を提案しました。教師モデルにプログラミング問題を解かせるのではなく、無関係な文脈で一般的な二つの単語からどちらを選ぶかを調べます。まず、教師と学生が共有するベースモデルが、二つの単語にほとんど差をつけないプロンプトを探します。その後、後学習済み教師が選んだ単語とプロンプトの組を、同じベースモデルから初期化した学生に学習させます。

主なポイント

  • 教師の出力は単語一つだけです。 学生はコード、目的タスクの例、教師のパラメーター、完全なlogitsを受け取りません。
  • ほぼ同率の判断を利用します。 ベースモデルが迷っている場所では、後学習による小さな確率変化が見えやすくなります。
  • コーディング性能が向上しました。 Qwen2.5-1.5Bの主要実験では、5664組の単語レベルデータが、ノイズを厳密にそろえた対照群に比べてHumanEval+を5.34ポイント押し上げました。
  • コードだけの現象ではありません。 科学知識、常識推論、読解でも転移が報告され、複数のモデル規模やモデル系列で観察されました。
  • 変化には組み合わせ可能性があります。 機能分析では、学習された変化が他の能力と組み合わせられ、教師側の更新が強いほど転移も強くなる傾向が示されています。

意義と限界

この研究は、無関係な生成を通じて特性や好みが伝わるという、従来の「サブリミナル学習」の議論を能力の領域へ広げます。単一の単語が持つ情報は少なくても、意図的に集めた多数の選択は、モデル更新の方向を示す信号になり得ます。

開発者にとっては、後学習の評価を目的ベンチマークだけに限定せず、無関係なプロンプト上の変化も確認すべきだという示唆になります。安全性の観点では、タスクに見えない低帯域の出力を通じて能力が抽出・伝達される可能性も、今後検討すべき課題です。

一方、提供された素材だけでは、より大規模なモデルや異なる学習レシピ、敵対的な条件で同じ効果が安定するかは判断できません。ATDは、後学習が残す「行動の影」を調べる実験手法として理解するのが適切です。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
NCP-ArchPreview:次のトークンから次の概念を予測する言語モデルへ
大規模言語モデル
cctest.ai
大規模言語モデル

NCP-ArchPreview:次のトークンから次の概念を予測する言語モデルへ

NCP-ArchPreviewは、従来の次トークン予測に、複数トークンをまたぐ離散的な「次の概念」予測を組み合わせる。自動回帰生成を維持しながら、潜在空間でより高い抽象度の学習を試みる構成だ。

続きを読む
CCTest · Blog
正解をまねるのではなく、誤った推論を避けてLLMを学習させる
大規模言語モデル
cctest.ai
大規模言語モデル

正解をまねるのではなく、誤った推論を避けてLLMを学習させる

Negative Self-Distillationは、特権情報を使った正解軌跡をそのまま模倣させるのではなく、モデル自身が生成した不完全な推論から離れるように学習する枠組みです。外部ラベルなしで探索と自己修正を保つことを目指します。

続きを読む
CCTest · Blog
多言語データの混合で、モデルは入力言語のまま推論できるか
大規模言語モデル
cctest.ai
大規模言語モデル

多言語データの混合で、モデルは入力言語のまま推論できるか

Cohere Labs は、推論モデルが英語に戻らず、ユーザーの入力言語で考えるための学習方法を検証した。3.35B パラメータの Tiny Aya L2-Thinker は、60言語で93%以上の言語内推論率を報告している。

続きを読む