PLC-DPO:ノイズを含む選好ラベルを補正するDPO
DPOは比較データの選好が正しいことを前提としますが、実際のデータには逆向きのラベルや差の小さいペア、判断が難しいペアが含まれます。PLC-DPOはポリシーと参照モデルの校正済みマージンを使い、各ペアを通常学習、反転学習、同等扱いへ振り分けます。
続きを読むDPOは比較データの選好が正しいことを前提としますが、実際のデータには逆向きのラベルや差の小さいペア、判断が難しいペアが含まれます。PLC-DPOはポリシーと参照モデルの校正済みマージンを使い、各ペアを通常学習、反転学習、同等扱いへ振り分けます。
続きを読むRadixArkが、最先端モデルの大規模ポストトレーニングを対象とするオープンソース基盤 Miles v0.1 を公開した。ロールアウト、学習、重み同期を一つの構成にまとめ、検証可能性と拡張性を重視している。
続きを読む弱い教師の出力をそのまま模倣するのではなく、教師が示した方策の変化を学習方向として利用する手法が提案された。OPRDは検証器が支持する更新だけを増幅し、学生モデル自身の最適化目標を維持する。
続きを読むFlowBalanceは、終端検証器による疎な結果信号と、同じモデルから得られる密な自己フィードバックを組み合わせる手法です。回答全体の軌跡を再重み付けし、失敗した推論に対する誤った自己支援を反転させます。
続きを読む長期タスクでは、軌跡全体が終わってから一つの報酬しか得られず、どの行動が結果に貢献したのか分かりにくい。DRACOは動的な評価基準を生成し、軌跡レベルの評価を関連するステップへ再配分する。
続きを読むCountdown課題を用いた研究から、RLVRによる解法空間の縮小は最初の算術操作より前に集中することが示された。モデルは別の解法を実行できるが、そこへ入らなくなっている。
続きを読む星塵智能(Astribot)のSmoothRLは、大規模モデルが生成した動作列と、ロボットが実際に実行した動作列のずれを解消するオンライン強化学習フレームワークだ。実行された動作だけを学習対象にすることで、非同期推論に対応する。
続きを読む新たな分析は、オンポリシー蒸留の性能向上が教師モデルの知識移転よりも、低確率トークンの抑制から生じている可能性を示した。この知見をもとに、教師を使わない On-Policy Self-Adaptation が提案されている。
続きを読むKAIST AI が提案する J-Zero は、人手によるラベル付きデータに依存せず、課題生成、問題解答、評価の3役を同時に適応させる枠組みです。検証可能な課題だけでなく、評価が難しい課題にも対応することを目指します。
続きを読むTTPOは、多数決による疑似ラベルをそのまま正解扱いせず、同意する推論と反対する推論に異なる学習処理を適用する。これにより、誤った多数決が教師信号全体を汚染するリスクを抑える。
続きを読む新しい研究は、大規模言語モデルの推論後学習における進化戦略(ES)の最適化特性を分析した。ESはPass@1を高めながら、より広い解答経路を維持し、Pass@KでGRPOを上回る可能性が示された。
続きを読むWarpSAC は、オフポリシー強化学習で常に同じ安定化手法を使うべきではないと指摘する。データが限られた CPU 学習向けと、大量データを生成できる GPU 並列学習向けに、異なる SAC 構成を提案した。
続きを読むCo-RLは、パラメータを共有しない複数モデルが互いのフィードバックから報酬を得て学習する強化学習の枠組みです。正解ラベルなしでも、テキストとマルチモーダルの推論性能を高め、自己評価型RLの崩壊リスクを抑えます。
続きを読むAgent Lightning v1.0は、ツール呼び出しやコンテキスト管理を担う実運用のエージェント・ハーネスを、モデルの強化学習に直接参加させる手法を提案する。6,000件の学習例と比較的少ない計算資源で、Qwen3.5-9BのSWE-bench Verifiedスコアを41.8%から56.4%へ引き上げた。
続きを読むDAPD は、オンポリシー自己蒸留で起きる性能劣化を、教師と学生の情報条件のズレとして捉え直す研究です。二重のアンカリングにより、推論時に再現できない特権依存の挙動が学生へ移ることを防ごうとします。
続きを読むRubric ベースの強化学習は、オープンエンドなLLMタスクで有望だが、評価基準ごとの学習信号が消える問題を抱える。CriPO は未探索基準と抑制された基準の両方に対処する手法として提案された。
続きを読む南京大学の論文は、RLVR における token 単位の信用割り当てを再検討している。大きな尤度変化は、推論上の重要性ではなく、表層表現の置き換えやすさを反映している場合が多いという。
続きを読むSAF-OPD は、検証可能な報酬による強化学習とオンポリシー蒸留を固定係数で混ぜると、探索が失われる可能性がある点に注目する。教師信号の大きさと投入タイミングを調整し、より安定した後学習を目指す手法だ。
続きを読むこの論文は、数学やコードでは有効な RLVR を、要約や創作のような正解が一つに定まらないタスクへ拡張しようとする。RLSVR はタスク変換によって、環境内のルールと相互作用から自動的に報酬を得る枠組みを提案している。
続きを読むSkill Self-Play は、検証可能な agent スキルを軸に、LLM の自己進化をより安定させるための枠組みだ。提案者、解答者、動的スキル制御器が強化学習ループの中で共進化する。
続きを読むMolt は、エージェント型強化学習研究における実装変更の負担を下げるために設計された PyTorch ネイティブの訓練フレームワークです。軽量なコードベースを保ちながら、非同期訓練、多モーダル方策、MoE 方策を扱える点を特徴とします。
続きを読む