記事一覧へ戻る
AIエージェント

Echoverse:PC操作エージェントを深く進化するアプリ環境で鍛える

読了目安 3 分

導入

コンピュータ利用エージェントは、画面を眺めるだけでは十分に学べない。クリックし、入力し、送信し、失敗し、その結果としてアプリの状態がどう変わったかを観察する必要がある。しかし実際に重要なアプリケーションの多くはログインが必要で、状態を持ち、繰り返し壊して初期化することも難しい。そのため研究では、実サイトの代わりに合成環境を用意する流れが強まっている。

Microsoft Research の Echoverse は、この合成環境の質に焦点を当てる。単に環境を大量に作るだけでは不十分であり、内部にどれだけ深い振る舞いがあるか、エージェントが実際に失敗する操作を狙えているか、そしてモデルの成長に合わせて環境も改善されるかが重要だという立場だ。

核心ポイント

  • 状態を持つアプリを生成:Echoverse は仕様をコンパイルし、内部データベースと状態変化を持つインタラクティブなアプリケーションを作る。
  • データベースに基づく採点:タスクの成功は、外部の曖昧な判断だけでなく、アプリ自身のデータベース上の変化で検証される。
  • 実行ログを二重に活用:採点済みの rollout は、環境・タスク・検証器の修復にも、モデル訓練の信号にも使われる。
  • 浅さより深さ:論文では、浅い環境が実サイトでの精度を下げる場合がある一方、深い環境は転移性能を高めると報告されている。
  • 強化学習にも利用可能:同じ環境を RL の場として使い、grounded verifier とステップごとの密な評価を組み合わせた報酬を設計している。

実験結果の意味

12 個の Echoverse 環境で訓練された 9B モデルは、14 の評価分割で 36.5% から 67.1% へ改善した。これは、教師役となったより大規模なフロンティアモデルとの差を 14 ポイント以内に縮めたという結果である。

さらに論文は、どの要素が効いたのかも分析している。同じドメインでは、浅い環境が live-site accuracy を 80.0 から 75.0 に下げた一方、深い環境は 80.0 から 85.0、別設定では 48.0 から 65.0 に引き上げた。ある UI コントロールを多様な表示で集中的に訓練すると、未見のウィジェット群やオープンウェブにも転移した。また、単一環境を修復するだけで、その環境で訓練したモデルは 16.2% から 38.5% へ向上した。RL 設定では、保持評価のスコアが 58.8% から 68.0% に上がっている。

影響

Echoverse が示すのは、エージェント訓練の中心が「データ例の収集」から「操作可能な世界の設計」へ移りつつあるということだ。アプリは静的な画面ではなく、制約、記録、副作用、隠れた状態を持つシステムである。見た目だけをまねた環境では、モデルは脆い近道を覚えてしまう可能性がある。

今後のエージェント基盤では、環境数だけでなく、信頼できる検証器、実際の失敗に対応するタスク設計、修復可能な環境ループが差別化要因になるだろう。Echoverse は 4 つの環境をベンチマークとして公開しており、アプリ、シードデータ、grounded grader を含む。これは完成形というより、より現実に近い訓練世界を作るための設計図といえる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Qwen-UI-Agent:実デバイス中心の次世代 GUI 基盤エージェント
AIエージェント
cctest.ai
AIエージェント

Qwen-UI-Agent:実デバイス中心の次世代 GUI 基盤エージェント

Qwen-UI-Agent は、モバイル、デスクトップ、ブラウザ、DeepSearch を単一の GUI エージェントとして扱うことを目指す技術報告です。焦点は単なる画面操作ではなく、実デバイス上で長いワークフローを安定して実行する能力にあります。

続きを読む
CCTest · Blog
ザッカーバーグ氏の個人AIエージェント構想、5年で数十億人へ?
AIエージェント
cctest.ai
AIエージェント

ザッカーバーグ氏の個人AIエージェント構想、5年で数十億人へ?

Metaは、個人向けAIエージェントを次世代プロダクトの中核に据えようとしている。ザッカーバーグ氏は、5年以内に数十億人が自分専用のAIエージェントを持つ可能性を示した。

続きを読む