記事一覧へ戻る
強化学習

推論モデルはなぜ自己学習で劣化するのか――R-Questが問題生成を見直す

読了目安 3 分

導入

推論モデルが問題を作り、自ら解き、そのデータで再び学習する自己進化の仕組みは、推論能力を継続的に高める方法として注目されている。しかし、この循環は自動的に高品質なデータを生み出すわけではない。ラウンドを重ねるほど、答えられない問題や、既に学習した問題の言い換えばかりを生成する可能性がある。

論文「Questioning the Questions: Sustaining Self-Evolution in Reasoning Models」は、この性能劣化の理由を分析し、自己学習の循環を長く維持するためのR-Questを提案した。

自己生成問題の2つの欠陥

研究が示す主な問題は次の2つである。

  • 無効な問題の増加。 条件が不足している、論理的に矛盾している、あるいは適切な解答を持たない問題が、ラウンドを重ねるにつれて増える。複数の答えが一致するかだけでデータを選別しても、問題そのものが成立しているとは限らない。論文では、こうしたフィルタリングが学習データ内の無効問題の割合を高める場合も指摘している。
  • 数学的な重複の見逃し。 既存の多様性制御は、単語や表面的な文章の類似度に依存しがちだ。そのため、表現は異なっていても数学的には同じ課題である問題を、新しい問題として扱ってしまう。これが蓄積すると、実質的な問題の多様性が失われる。

つまり自己進化の課題は、解答器の能力だけではない。出題器がどのような練習材料を供給し続けるかも、性能を左右する。

R-Questの仕組み

R-Questは、最終的な答えの整合性だけでなく、「問題が有効か」「本当に新しいか」をフィードバックとして利用する。

まず、解答器に無効な問題を認識して拒否する能力を学習させる。その判断を出題器の報酬設計に反映し、同時に解答器の学習データから問題のある例を除外する。これにより、誤った問題が循環の中で増幅されることを抑える。

次に、語句の違いだけでは判定しにくい重複を見つけるため、凍結した基盤モデルでサンプリングした問題のペアを比較し、新規性のフィードバックを与える。固定されたモデルを基準にすることで、異なる表現が同じ数学的課題を示しているかをより安定して調べる。

結果と意味

論文によると、R-Questは2つのモデル系列を対象に、数学推論、一般領域推論、コード生成を含む12のベンチマークで最高の平均性能を示した。さらに10回の自己進化ラウンドを通じて改善を維持し、最終ラウンドでピークに達した。R-Zeroとの比較では17.32ポイント上回っている。

この研究の重要な示唆は、答えの一致だけでは自己生成データを検証できないという点にある。問題が成立しているか、そして新しい能力への挑戦になっているかを確認しなければならない。有効性のフィードバックは誤った教師信号の拡散を抑え、新規性のフィードバックは学習カリキュラムの縮小を防ぐ。

自己進化を長期的に機能させるには、学習アルゴリズムだけでなく、問題の品質管理も不可欠だ。今後は難易度や情報利得、分野をまたぐ重複をどう測るかが、さらなる課題になるだろう。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
SRD、事後の経験をRLVRの事前予測へ蒸留
強化学習
cctest.ai
強化学習

SRD、事後の経験をRLVRの事前予測へ蒸留

Self-Retrospection Distillation(SRD)は、エージェントがタスクを終えた後の軌跡を使い、行動前に予測すべき落とし穴を学習させる手法です。グループ内の報酬が均一になりやすい強化学習でも、軌跡に残る情報を学習信号として活用します。

続きを読む
CCTest · Blog
NeMo-DCR、兆パラメータ級エージェントRLの重み同期を約35倍高速化
強化学習
cctest.ai
強化学習

NeMo-DCR、兆パラメータ級エージェントRLの重み同期を約35倍高速化

NeMo-DCRは、学習クラスタとrolloutクラスタの間で変更された重みだけを転送しながら、完全なチェックポイント読み込みとビット単位で一致する結果を実現します。1兆パラメータ、変更率3%のテストでは、refit時間を87.5分から2.5分に短縮しました。

続きを読む