AREX-2:長期的な反省と反復で成長するAIエージェント
一度の回答から、継続的な改善へ
大規模言語モデルのエージェントは、もっともらしい回答を一度で生成できても、その結果を検証し、フィードバックを取り込み、何度も改善できるとは限らない。AREX-2はこの差に焦点を当てる。ここでいう自己改善とは、テスト時に解を反復的に見直し、現在の解より良いものへ更新する能力である。
研究チームは、この能力を二つの要素に分けている。
- 反省:現在の解の問題を把握し、より良い修正版を作ること。
- 長期実行:複数ラウンドにわたり目的と過去の結果を維持し、改善を実際の行動につなげること。
反省だけでは、改善案を出しても実装まで到達しない可能性がある。一方、長期実行だけでは、同じ作業を繰り返すだけになりかねない。AREX-2の仮説は、この二つの能力にはドメインをまたいで学習できる部分があり、より明確な教師信号を得られる領域で訓練できるというものだ。
検証可能なフィードバックを訓練に利用
データ作成では、機械学習とアルゴリズムプログラミングの課題から、長期的な改善軌跡を合成する。これらの領域では、成果を比較的明確に評価できるため、単なる最終回答だけでなく、試行、実行、評価、誤りの発見、再修正という流れを記録しやすい。
Qwen3.8-27Bを基盤とするエージェントは、MLE-bench Liteで81.8、Frontier-CSで70.7を達成した。さらに、深い調査に関する評価でも、BrowseCompは84.0、HLEは52.6、GAIAは92.2、DeepSearchQAは93.8だった。技術課題から学習した長期改善の振る舞いが、少なくとも報告されたベンチマークでは調査タスクにも転移したことを示している。要約によれば、利用できる反復ラウンド数を増やすほど性能も伸び続ける。
意義と残された論点
AREX-2は、単にモデルを大型化するのとは異なる訓練の方向性を示す。最初の回答の質だけでなく、検証と修正を含む問題解決の軌跡そのものを学習対象にする考え方である。実験、デバッグ、検証、再設計が必要な業務では、この性質が重要になる可能性がある。
ただし、提供された素材には、軌跡の合成方法の詳細、比較実験、長期推論のコスト、ラウンドごとの改善曲線は含まれていない。効果が反省データ、長期実行訓練、または両者の組み合わせのどこから生じたのかは、論文本文とコードによる確認が必要だ。
コメント
ログイン状態を確認中…
コメントを読み込み中…