進化戦略はなぜGRPOより多様な推論経路を保てるのか
新しい研究は、大規模言語モデルの推論後学習における進化戦略(ES)の最適化特性を分析した。ESはPass@1を高めながら、より広い解答経路を維持し、Pass@KでGRPOを上回る可能性が示された。
続きを読む新しい研究は、大規模言語モデルの推論後学習における進化戦略(ES)の最適化特性を分析した。ESはPass@1を高めながら、より広い解答経路を維持し、Pass@KでGRPOを上回る可能性が示された。
続きを読むTTPOは、多数決による疑似ラベルをそのまま正解扱いせず、同意する推論と反対する推論に異なる学習処理を適用する。これにより、誤った多数決が教師信号全体を汚染するリスクを抑える。
続きを読むWarpSAC は、オフポリシー強化学習で常に同じ安定化手法を使うべきではないと指摘する。データが限られた CPU 学習向けと、大量データを生成できる GPU 並列学習向けに、異なる SAC 構成を提案した。
続きを読むCo-RLは、パラメータを共有しない複数モデルが互いのフィードバックから報酬を得て学習する強化学習の枠組みです。正解ラベルなしでも、テキストとマルチモーダルの推論性能を高め、自己評価型RLの崩壊リスクを抑えます。
続きを読むAgent Lightning v1.0は、ツール呼び出しやコンテキスト管理を担う実運用のエージェント・ハーネスを、モデルの強化学習に直接参加させる手法を提案する。6,000件の学習例と比較的少ない計算資源で、Qwen3.5-9BのSWE-bench Verifiedスコアを41.8%から56.4%へ引き上げた。
続きを読むDAPD は、オンポリシー自己蒸留で起きる性能劣化を、教師と学生の情報条件のズレとして捉え直す研究です。二重のアンカリングにより、推論時に再現できない特権依存の挙動が学生へ移ることを防ごうとします。
続きを読むSAF-OPD は、検証可能な報酬による強化学習とオンポリシー蒸留を固定係数で混ぜると、探索が失われる可能性がある点に注目する。教師信号の大きさと投入タイミングを調整し、より安定した後学習を目指す手法だ。
続きを読む南京大学の論文は、RLVR における token 単位の信用割り当てを再検討している。大きな尤度変化は、推論上の重要性ではなく、表層表現の置き換えやすさを反映している場合が多いという。
続きを読むRubric ベースの強化学習は、オープンエンドなLLMタスクで有望だが、評価基準ごとの学習信号が消える問題を抱える。CriPO は未探索基準と抑制された基準の両方に対処する手法として提案された。
続きを読むこの論文は、数学やコードでは有効な RLVR を、要約や創作のような正解が一つに定まらないタスクへ拡張しようとする。RLSVR はタスク変換によって、環境内のルールと相互作用から自動的に報酬を得る枠組みを提案している。
続きを読むMolt は、エージェント型強化学習研究における実装変更の負担を下げるために設計された PyTorch ネイティブの訓練フレームワークです。軽量なコードベースを保ちながら、非同期訓練、多モーダル方策、MoE 方策を扱える点を特徴とします。
続きを読むSkill Self-Play は、検証可能な agent スキルを軸に、LLM の自己進化をより安定させるための枠組みだ。提案者、解答者、動的スキル制御器が強化学習ループの中で共進化する。
続きを読むこの論文は、RLVRによる能力向上が重みの特異値スペクトルの大幅な書き換えではなく、入力・出力側の特異フレームの変化に宿ると主張する。その観察をもとに、固定スペクトル型の最適化スタック ISO を提案している。
続きを読む非同期強化学習はスループットを高める一方、rollout と学習時点の方策がずれるという問題を抱える。SAT はサンプルの陳腐化度に応じて PPO 風のクリップ区間を調整し、高リスクな更新をより保守的に扱う。
続きを読むGEPO は GRPO を軽量に拡張し、prompt グループごとの熵を使って advantage を非対称に調整する手法です。混合タスク学習で起きやすい探索と利用の不均衡に対応しようとしています。
続きを読むこの論文は、LLMの「採点者」役を「コーチ」役へと拡張し、単一スカラーではなく経験知を学習信号に使う方法を提案する。非検証型タスクでの学習を、より細かなフィードバックに基づいて進めようとしている。
続きを読むDistilled Reinforcement Learning は、結果報酬に依存する強化学習と、教師分布を無条件に模倣するオンライン蒸留の間を狙う手法です。教師モデルの選好を token レベルの方策勾配に反映します。
続きを読むSVR-R1 は、推論時の自己チェックを強化学習の訓練ループに組み込む手法です。モデルは回答を出した後、自ら Yes/No で判定し、No の場合は再考します。
続きを読むこの論文は、RLVR におけるエントロピー中心の advantage shaping の限界を指摘し、Contrastive Policy Optimization(CPO)を提案している。参照誘導生成と通常生成の token レベルの分布差を使い、より正しさに近い学習信号を作る点が特徴だ。
続きを読むこの研究は、Muon を疎報酬のエージェント強化学習に適用し、その効果が優位性推定器と学習率の組み合わせに強く依存することを示している。
続きを読む