記事一覧へ戻る
強化学習

拡散モデルで報酬を生成するDRM、人間の好みを単一スコアから分布へ

読了目安 3 分

導入

RLHFでは、報酬モデルが人間の評価を言語モデルの最適化に使える信号へ変換する。従来の多くの手法は、プロンプトと回答の組に対して単一のスカラー報酬を出力するか、報酬が特定のパラメトリック分布に従うと仮定する。しかし実際の人間の好みは、必ずしも一つの評価に収束しない。同じ回答でも、正確さや安全性、表現の明快さなど、異なる観点から肯定的に評価される可能性がある。

清華大学NLPグループの Diffusion Reward Model(DRM)は、この不確実性を報酬モデルに組み込もうとする。研究では報酬モデリングを、入力と回答を条件とした p(r|x,y) の条件付き密度推定として定式化し、単一値ではなく報酬の分布を学習する。

手法のポイント

  • 拡散過程で報酬を生成:凍結した大規模言語モデルのエンコーダーで入力を表現し、軽量なDiffusion Transformerがガウスノイズから報酬ベクトルを段階的に復元する。
  • 分布形状を固定しない:ガウス分布などの単純な出力分布をあらかじめ仮定しないため、複数の山を持つようなマルチモーダルな評価を表現しやすい。
  • 複数の教師信号に対応:多属性回帰とペアワイズ選好データを、一つのアーキテクチャで扱える。
  • 不確実性を意思決定に利用:同じ入力から複数の報酬をサンプリングし、経験的な報酬分布を作る。そこから代表値、分散、分位点などを取り出せる。

実験が示すこと

5つのベンチマークで、DRMはデータとバックボーンを揃えたベースラインに対して同等以上の結果を示したと報告されている。比較的大規模な判別型・分布型・生成型の報酬モデルに対しても、限られた学習規模で競争力を保った。また、通常の報酬ヘッドが複数の評価モードを一つの点へ押し込むのに対し、DRMはその構造を復元できるという。

分布情報は分析だけに使われるわけではない。研究では、不確実性を考慮した棄却や、下側信頼限界(LCB)による集約も検証している。これにより、予測報酬の高さだけでなく、その推定がどれほど不確かかを意思決定に反映できる。さらに、DRMを学習時の報酬として使うRLHF実験では、ポリシー性能の改善が報告され、分布型報酬が最適化にも関係し得ることを示した。

意義と課題

DRMは、報酬モデルを決定論的な採点器ではなく、人間の判断を条件付きで生成するモデルとして捉える方向を示す。評価者間の意見の違いや、複数の品質軸が存在する場面では、単一スコアより豊かな情報を持てる可能性がある。

ただし、提供された素材にはベンチマークごとの詳細な数値、サンプリングのコスト、集約手法の比較結果までは含まれていない。そのため、従来手法を全面的に置き換えると結論づけることはできない。実運用では、追加サンプリングの負荷と不確実性情報の価値、そして学習された分布が本当に対象ユーザーの選好を反映しているかを検証する必要がある。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
QwenGyre、超長期エージェント強化学習のGPU待機と軌跡の重複に対応
強化学習
cctest.ai
強化学習

QwenGyre、超長期エージェント強化学習のGPU待機と軌跡の重複に対応

Qwenは、極端に長いタスク向けのオンライン強化学習フレームワーク「QwenGyre」を提案した。ロールアウトと学習の間でGPUを柔軟に再配分し、分岐履歴の再構成や軌跡の重複排除を行う。

続きを読む
CCTest · Blog
VLA-Precision:VLAロボットの実世界オンライン強化学習を安定化
強化学習
cctest.ai
強化学習

VLA-Precision:VLAロボットの実世界オンライン強化学習を安定化

VLA-Precisionは、視覚言語行動モデルを実世界でオンライン強化学習する際の方策ドリフトと計算コストに取り組む。ACoBによる段階的な価値校正と、ACoB-Streamによるストリーミング処理を組み合わせる。

続きを読む