Echoverse:PC操作エージェントを深く進化するアプリ環境で鍛える
導入
コンピュータ利用エージェントは、画面を眺めるだけでは十分に学べない。クリックし、入力し、送信し、失敗し、その結果としてアプリの状態がどう変わったかを観察する必要がある。しかし実際に重要なアプリケーションの多くはログインが必要で、状態を持ち、繰り返し壊して初期化することも難しい。そのため研究では、実サイトの代わりに合成環境を用意する流れが強まっている。
Microsoft Research の Echoverse は、この合成環境の質に焦点を当てる。単に環境を大量に作るだけでは不十分であり、内部にどれだけ深い振る舞いがあるか、エージェントが実際に失敗する操作を狙えているか、そしてモデルの成長に合わせて環境も改善されるかが重要だという立場だ。
核心ポイント
- 状態を持つアプリを生成:Echoverse は仕様をコンパイルし、内部データベースと状態変化を持つインタラクティブなアプリケーションを作る。
- データベースに基づく採点:タスクの成功は、外部の曖昧な判断だけでなく、アプリ自身のデータベース上の変化で検証される。
- 実行ログを二重に活用:採点済みの rollout は、環境・タスク・検証器の修復にも、モデル訓練の信号にも使われる。
- 浅さより深さ:論文では、浅い環境が実サイトでの精度を下げる場合がある一方、深い環境は転移性能を高めると報告されている。
- 強化学習にも利用可能:同じ環境を RL の場として使い、grounded verifier とステップごとの密な評価を組み合わせた報酬を設計している。
実験結果の意味
12 個の Echoverse 環境で訓練された 9B モデルは、14 の評価分割で 36.5% から 67.1% へ改善した。これは、教師役となったより大規模なフロンティアモデルとの差を 14 ポイント以内に縮めたという結果である。
さらに論文は、どの要素が効いたのかも分析している。同じドメインでは、浅い環境が live-site accuracy を 80.0 から 75.0 に下げた一方、深い環境は 80.0 から 85.0、別設定では 48.0 から 65.0 に引き上げた。ある UI コントロールを多様な表示で集中的に訓練すると、未見のウィジェット群やオープンウェブにも転移した。また、単一環境を修復するだけで、その環境で訓練したモデルは 16.2% から 38.5% へ向上した。RL 設定では、保持評価のスコアが 58.8% から 68.0% に上がっている。
影響
Echoverse が示すのは、エージェント訓練の中心が「データ例の収集」から「操作可能な世界の設計」へ移りつつあるということだ。アプリは静的な画面ではなく、制約、記録、副作用、隠れた状態を持つシステムである。見た目だけをまねた環境では、モデルは脆い近道を覚えてしまう可能性がある。
今後のエージェント基盤では、環境数だけでなく、信頼できる検証器、実際の失敗に対応するタスク設計、修復可能な環境ループが差別化要因になるだろう。Echoverse は 4 つの環境をベンチマークとして公開しており、アプリ、シードデータ、grounded grader を含む。これは完成形というより、より現実に近い訓練世界を作るための設計図といえる。
コメント
ログイン状態を確認中…
コメントを読み込み中…