記事一覧へ戻る
AIエージェント

AREX-2:長期的な反省と反復で成長するAIエージェント

読了目安 3 分

一度の回答から、継続的な改善へ

大規模言語モデルのエージェントは、もっともらしい回答を一度で生成できても、その結果を検証し、フィードバックを取り込み、何度も改善できるとは限らない。AREX-2はこの差に焦点を当てる。ここでいう自己改善とは、テスト時に解を反復的に見直し、現在の解より良いものへ更新する能力である。

研究チームは、この能力を二つの要素に分けている。

  • 反省:現在の解の問題を把握し、より良い修正版を作ること。
  • 長期実行:複数ラウンドにわたり目的と過去の結果を維持し、改善を実際の行動につなげること。

反省だけでは、改善案を出しても実装まで到達しない可能性がある。一方、長期実行だけでは、同じ作業を繰り返すだけになりかねない。AREX-2の仮説は、この二つの能力にはドメインをまたいで学習できる部分があり、より明確な教師信号を得られる領域で訓練できるというものだ。

検証可能なフィードバックを訓練に利用

データ作成では、機械学習とアルゴリズムプログラミングの課題から、長期的な改善軌跡を合成する。これらの領域では、成果を比較的明確に評価できるため、単なる最終回答だけでなく、試行、実行、評価、誤りの発見、再修正という流れを記録しやすい。

Qwen3.8-27Bを基盤とするエージェントは、MLE-bench Liteで81.8、Frontier-CSで70.7を達成した。さらに、深い調査に関する評価でも、BrowseCompは84.0、HLEは52.6、GAIAは92.2、DeepSearchQAは93.8だった。技術課題から学習した長期改善の振る舞いが、少なくとも報告されたベンチマークでは調査タスクにも転移したことを示している。要約によれば、利用できる反復ラウンド数を増やすほど性能も伸び続ける。

意義と残された論点

AREX-2は、単にモデルを大型化するのとは異なる訓練の方向性を示す。最初の回答の質だけでなく、検証と修正を含む問題解決の軌跡そのものを学習対象にする考え方である。実験、デバッグ、検証、再設計が必要な業務では、この性質が重要になる可能性がある。

ただし、提供された素材には、軌跡の合成方法の詳細、比較実験、長期推論のコスト、ラウンドごとの改善曲線は含まれていない。効果が反省データ、長期実行訓練、または両者の組み合わせのどこから生じたのかは、論文本文とコードによる確認が必要だ。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
X-Tree:再利用可能な経験をAIエージェントの学習資源に変える
AIエージェント
cctest.ai
AIエージェント

X-Tree:再利用可能な経験をAIエージェントの学習資源に変える

X-Treeは、エージェントの軌跡から繰り返し現れ、成功と結び付く行動のまとまりを自動抽出し、再利用可能な経験ツリーにまとめる手法です。LLMを追加で呼び出さず、オフライン強化学習、RLVR、自己蒸留に活用します。

続きを読む
CCTest · Blog
なぜLLMエージェントは撤回された指示に従い続けるのか
AIエージェント
cctest.ai
AIエージェント

なぜLLMエージェントは撤回された指示に従い続けるのか

新しい研究は、ユーザーが変更・撤回した要件が回答やツール操作に残り続ける「意図ドリフト」を測定可能な失敗モードとして整理した。IntentFluxとStateForgeの評価から、明示的な状態管理は有効だが、単一ターンの性能を完全には取り戻せないことが示された。

続きを読む
CCTest · Blog
検索エージェントはなぜ「共謀」するのか:CrossFitで自律進化の誤った改善を抑える
AIエージェント
cctest.ai
AIエージェント

検索エージェントはなぜ「共謀」するのか:CrossFitで自律進化の誤った改善を抑える

自律進化型の検索エージェントでは、提案者と解答者が同じ誤りに同意し、内部報酬だけが上昇する場合がある。CrossFitは、学習に使う情報源と評価経路を分離して、この問題を緩和する。

続きを読む