記事一覧へ戻る
強化学習

Co-RL、多様なAI群の協調で教師なし推論を実現

読了目安 3 分

教師なし推論が直面する壁

大規模言語モデルや視覚言語モデルの推論能力を高める方法として、強化学習の重要性が増しています。一方で、現在の強力な手法の多くは、正解との照合が可能な報酬や人間による評価を必要とします。問題が複雑になるほど、人間が出力の推論過程を正確に判定することは難しくなり、十分な教師信号を集めるコストも上昇します。

そこで注目されるのが自己報酬型の強化学習です。モデル自身に回答を評価させれば、外部ラベルへの依存を減らせます。しかし、回答者と評価者が同じモデルであるため、既存のバイアスや近道、誤った判断を自ら強化する危険があります。学習が進むと出力の幅が狭まり、似た回答ばかりになり、最終的に学習崩壊へ向かう可能性もあります。

Co-RLの仕組み

Co-RLは、この自己評価を複数モデル間の協調へ置き換えます。フレームワークでは、パラメータを共有しない複数のモデルを同時に強化学習で最適化し、仲間のモデルが生成したフィードバックから報酬を作ります。各モデルは独自の表現や推論傾向を保つため、単一モデルでは得にくい異なる見方を学習信号として利用できます。

重要なのは、単にモデル数を増やすことではありません。研究では、異なるモデルファミリーや規模を組み合わせ、さらに学習サンプルを言い換えることでコホートの多様性を高めています。全モデルが同じ入力に対して同じ誤りを犯す可能性を下げれば、あるモデルの間違いが集団内で無条件に承認されるフィードバックループを弱められます。

主なポイントは次の通りです。

  • パラメータを共有しない複数モデルが仲間の報酬で学習する;
  • 正解ラベルや外部の真値報酬を使わない;
  • モデルの異質性とデータの言い換えが相関誤差を抑える;
  • 多様性が推論性能、行動の多様性、学習安定性を支える;
  • テキストとマルチモーダルの両方を対象とする。

結果と意義

論文概要によると、言語モデルでは七つのテキストベンチマークで平均3.0~8.6%の向上を報告しています。視覚言語モデルでは、四つのマルチモーダルベンチマークで平均2.3~7.2%の向上が示されています。Co-RLはベースモデルや従来のラベルなし手法を上回り、教師あり手法と同等以上の結果に達したとされています。これらの学習には真値ラベルを使用していません。

この研究の意義は、外部の評価者が不足する状況で、モデル間の違いそのものを探索と誤り訂正の資源として扱った点にあります。ただし、仲間の評価が常に正しいとは限りません。すべてのモデルが同じデータ上の偏りや評価基準を共有していれば、集団で同じ誤判断に収束する可能性は残ります。今後は、コホートの構成や報酬の集約方法、タスクの開放性が学習の安定性にどう影響するかを検証する必要があります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Agent Lightning v1.0、エージェント・ハーネスを強化学習に組み込む
強化学習
cctest.ai
強化学習

Agent Lightning v1.0、エージェント・ハーネスを強化学習に組み込む

Agent Lightning v1.0は、ツール呼び出しやコンテキスト管理を担う実運用のエージェント・ハーネスを、モデルの強化学習に直接参加させる手法を提案する。6,000件の学習例と比較的少ない計算資源で、Qwen3.5-9BのSWE-bench Verifiedスコアを41.8%から56.4%へ引き上げた。

続きを読む
CCTest · Blog
DAPD:方策蒸留における「特権情報の錯覚」をどう抑えるか
強化学習
cctest.ai
強化学習

DAPD:方策蒸留における「特権情報の錯覚」をどう抑えるか

DAPD は、オンポリシー自己蒸留で起きる性能劣化を、教師と学生の情報条件のズレとして捉え直す研究です。二重のアンカリングにより、推論時に再現できない特権依存の挙動が学生へ移ることを防ごうとします。

続きを読む
CCTest · Blog
SAF-OPD:強化学習とオンポリシー蒸留を安定に組み合わせる
強化学習
cctest.ai
強化学習

SAF-OPD:強化学習とオンポリシー蒸留を安定に組み合わせる

SAF-OPD は、検証可能な報酬による強化学習とオンポリシー蒸留を固定係数で混ぜると、探索が失われる可能性がある点に注目する。教師信号の大きさと投入タイミングを調整し、より安定した後学習を目指す手法だ。

続きを読む