記事一覧へ戻る
強化学習

Agon:競争する2つのモデルで推論過程を暗黙的に評価する

読了目安 3 分

導入

現在の推論モデルの多くは、検証可能な報酬に基づく強化学習に支えられています。答えが正しいかどうかを機械的に判定できれば、学習信号を与えやすいからです。GRPO のような手法はこの方向性を実用的にしましたが、同時に弱点もあります。評価されるのは主に最終回答であり、その途中にある推論の質ではありません。

難しい問題では、この仕組みが「よりよく考える」ことよりも「より長く書く」ことを促す可能性があります。Agon はこの問題に対して、人手による推論ステップのラベル付けや追加の報酬モデルを使わず、2つのモデルを競争させるという方法を提案します。

核心ポイント

  • 2モデルが同じ問題に挑む:Agon では、2つのモデルが同一の問題を解きます。片方がまず解法の下書きを作り、もう片方がそれを読みながら解答します。
  • 役割を交替する:モデルは交互に下書き役と解答役を担います。片方だけが固定的に教師や採点者になるのではなく、双方が学習対象になります。
  • 報酬は相手を上回ること:単に正解するだけでなく、相手よりよく解くことが重要になります。下書きが冗長で役に立たなければ、読んだ相手に容易に追い越される可能性があります。
  • 推論過程を暗黙的に評価:良い推論とは何かを明示的にラベル化しなくても、競争の結果を通じて推論の価値が学習信号になります。
  • 推論時も同じ構造を使う:実運用では、1つ目のモデルが下書きを作り、2つ目のモデルがそれを読んで最終回答を出す2段階カスケードとして使われます。

意義と影響

論文によると、Qwen3 を用いた DeepMath の hard split で、Agon は GRPO の pass@1 を約2倍にしたとされています。また、同じベースモデルに対する未訓練の Mixture-of-Agents と比べ、改善幅は約8倍だったと報告されています。さらに、競技プログラミングのコード課題や Qwen3.5、Gemma 4 などのモデルファミリーでも同様の傾向が再現されたとしています。

この研究の面白さは、過程監督をデータ作成の問題ではなく、競争環境の設計問題として扱っている点にあります。人間が「良い思考の形」を逐一定義する代わりに、相手に読まれてもなお勝てる推論を学ばせるわけです。

一方で、実装上の課題もあります。2つのモデルを訓練・推論に使うため、単一モデルより計算コストやレイテンシが増える可能性があります。また、2モデルは能力が近く、かつ振る舞いが異なる必要があるとされており、どのように良い組み合わせを選ぶかも重要です。現段階ではモデル同士はテキストでやり取りしていますが、論文は将来的に潜在空間で共同推論する方向を示しています。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
OPD²:推論チューニングで増えた能力だけを蒸留する新手法
強化学習
cctest.ai
強化学習

OPD²:推論チューニングで増えた能力だけを蒸留する新手法

NAVER AI Lab の OPD² は、教師モデルの出力分布をそのまま模倣するのではなく、推論チューニング後の教師とベースモデルの差分を蒸留信号として使う。論文では、数学・科学・コード推論で従来の on-policy distillation を上回ると報告されている。

続きを読む
CCTest · Blog
CPO:エントロピーを超える正しさ認識型 RLVR の提案
強化学習
cctest.ai
強化学習

CPO:エントロピーを超える正しさ認識型 RLVR の提案

この論文は、RLVR におけるエントロピー中心の advantage shaping の限界を指摘し、Contrastive Policy Optimization(CPO)を提案している。参照誘導生成と通常生成の token レベルの分布差を使い、より正しさに近い学習信号を作る点が特徴だ。

続きを読む