記事一覧へ戻る
大規模言語モデル

正解をまねるのではなく、誤った推論を避けてLLMを学習させる

読了目安 3 分

導入

大規模言語モデルの推論能力を高める方法として、優れた解答過程を模倣させる学習が広く使われています。On-Policy Self-Distillation(OPSD)は、モデル自身が出力を生成しながら、正解解答などの特権情報を教師信号として利用する考え方です。しかし、論文「Negative Self-Distillation: Learning to Reason by Avoiding Flaws」は、難しい課題では逆方向の学習が有効ではないかと問いかけます。つまり、理想的な推論をコピーするのではなく、欠陥のある推論を避けるという発想です。

主なポイント

  • 従来の蒸留への問題提起:特権情報を使った教師軌跡は、実際の推論よりも確信的で整然として見えることがあります。それを学生モデルに強く模倣させると、不確実性の表現、試行錯誤、後戻り、自己修正が抑えられる可能性があります。
  • 負の教師を自分で作る:Negative Self-Distillation(NSD)は、外部教師や正解ラベルに依存しません。問題ごとに「不注意な推論者」のような負の条件をモデル自身に生成させ、その結果得られた欠陥軌跡から出力分布を遠ざけます。
  • 無差別な反学習を避ける:単純に誤った系列の確率を下げると、推論の誤りと、普通の言語表現に使われる token が混同されます。その結果、推論だけでなく基礎的な文章能力まで損なうおそれがあります。
  • 動的ゲーティング:提案手法は動的なゲートによって推論に重要な token を識別し、更新対象を絞ります。狙いは、言語能力を維持しながら推論上の欠陥に学習信号を集中させることです。

意義と残された課題

NSDの意義は、自己改善の信号を成功例だけに求めない点にあります。複数の仮説を試し、誤りを発見して修正する必要がある問題では、完成された正解経路を一つコピーするよりも、避けるべき失敗パターンを学ぶ方が推論の柔軟性を保ちやすい可能性があります。

一方、提供された資料には、詳細な損失関数、評価ベンチマーク、比較結果、アブレーションは含まれていません。そのため、NSDが従来の自己蒸留を安定して上回るか、負の条件をどの程度再現性よく作れるかは判断できません。今後は、信頼できる正解軌跡で方向性を示しつつ、負の軌跡で不注意な推論を抑える組み合わせが現実的な設計になりそうです。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
NCP-ArchPreview:次のトークンから次の概念を予測する言語モデルへ
大規模言語モデル
cctest.ai
大規模言語モデル

NCP-ArchPreview:次のトークンから次の概念を予測する言語モデルへ

NCP-ArchPreviewは、従来の次トークン予測に、複数トークンをまたぐ離散的な「次の概念」予測を組み合わせる。自動回帰生成を維持しながら、潜在空間でより高い抽象度の学習を試みる構成だ。

続きを読む
CCTest · Blog
多言語データの混合で、モデルは入力言語のまま推論できるか
大規模言語モデル
cctest.ai
大規模言語モデル

多言語データの混合で、モデルは入力言語のまま推論できるか

Cohere Labs は、推論モデルが英語に戻らず、ユーザーの入力言語で考えるための学習方法を検証した。3.35B パラメータの Tiny Aya L2-Thinker は、60言語で93%以上の言語内推論率を報告している。

続きを読む
CCTest · Blog
なぜLLMは解答不能な質問に答えるのか:認識と拒否のずれ
大規模言語モデル
cctest.ai

なぜLLMは解答不能な質問に答えるのか:認識と拒否のずれ

1.7Bから70B規模の指示チューニングモデルを調べた研究は、モデルが数学やコードの構造的に解答不能な入力を生成前に認識している可能性を示した。それでも拒否できない原因は、認識能力の欠如よりも、認識を行動へつなぐルーティングの失敗にある。

続きを読む