OPD²:推論チューニングで増えた能力だけを蒸留する新手法
NAVER AI Lab の OPD² は、教師モデルの出力分布をそのまま模倣するのではなく、推論チューニング後の教師とベースモデルの差分を蒸留信号として使う。論文では、数学・科学・コード推論で従来の on-policy distillation を上回ると報告されている。
続きを読むNAVER AI Lab の OPD² は、教師モデルの出力分布をそのまま模倣するのではなく、推論チューニング後の教師とベースモデルの差分を蒸留信号として使う。論文では、数学・科学・コード推論で従来の on-policy distillation を上回ると報告されている。
続きを読むSEED は、完了した on-policy 軌跡を自然言語の「事後スキル」に変換し、その行動上の効果を方策モデルへ蒸留するエージェント向け強化学習フレームワークです。
続きを読むLongStraw は、百万 token 級の推論能力と短い文脈に留まりがちな RL 後学習のギャップを埋めようとする実行スタックです。共有プロンプトを勾配なしで処理し、応答分岐を再実行することでメモリ負荷を抑えます。
続きを読むRing-Zero は、人手で注釈した推論データを使わず、検証可能な報酬で推論能力を引き出す zero RL を 1T パラメータ規模で検証する研究だ。大規模化により、サンプル効率や性能上限だけでなく、自己検証や構造化された推論の出現も報告されている。
続きを読むarXivに投稿された論文が、LLMの事後学習で使われるOn-Policy Distillationの役割と失敗要因を整理した。OPDの成否は、教師信号の質と学生モデルとの適合性に大きく左右されるという。
続きを読むこの論文は、GFlowNet風の強化学習を大規模言語モデルの後処理学習に適用しやすくする GFlowRL を提案している。学習型の分配関数ネットワークを外し、バッチ内モンテカルロ推定に置き換える点が中核だ。
続きを読むこの arXiv 論文は、RL 後学習のコストを単一の総 FLOPs だけで語ることの限界を指摘する。固定予算の下で、より大きなモデル、長い学習、rollout 探索、強い報酬フィードバックのどれに計算を割くべきかを検討している。
続きを読むarXiv の新論文は、訓練中に見つけた高性能な回路設定を「灯台」として保存し、後続の探索のリセット地点に使う Lighthouse RL を提案している。狙いは、アナログ回路サイズ最適化における無駄な探索を減らすことだ。
続きを読むarXiv の新論文は、垂直運動する倒立振子を安定化する強化学習問題に、リャプノフ特性指数を物理情報に基づく密な報酬として用いる方法を提案している。エージェントは Kapitza 振子として知られる振動安定化だけでなく、支点の揺れを減衰させて厳密な直立状態を実現したと報告されている。
続きを読むarXiv に投稿された TRACE は、長いツール利用軌跡に対して密な報酬を与えるための信用割当手法だ。凍結した参照モデルを使い、最終回答の信号を各ツール呼び出しの報酬へ変換する。
続きを読むarXiv に投稿された SIVA-RL は、画像介入の種類ではなく実際の報酬変化に基づいて視覚アライメントの監督信号を割り当てる手法です。視覚言語モデルが画像証拠に根ざして推論することを狙います。
続きを読むDAGR は、目標条件付き強化学習における静的な目標埋め込みの弱点に着目する。OGBench のナビゲーションでは改善を示す一方、操作や puzzle 系タスクでは基盤手法を安定して上回るわけではない。
続きを読む