RecreationWorld、ソフトウェア再現でコンピューター操作エージェントを評価
背景
コンピューター操作エージェントの研究は、これまで大きく二つの方向に分かれていました。一つは、クリックや入力、画面認識によってグラフィカルインターフェースを操作する方向です。もう一つは、コード、ターミナル、開発ツールを使ってソフトウェアを作る方向です。しかし実際のデジタル作業では、両者は分離していません。アプリケーションを観察し、実装し、起動後に画面と動作を確認するという往復が必要になります。
RecreationWorldは、この一連の作業を一つの課題として扱います。エージェントには動作中の参照アプリケーションが与えられますが、操作手順は指定されません。エージェントはまず機能や挙動を探索し、その後に参照に近い実装を作成し、実行と視覚的な確認を通して問題を修正します。ここで問われるのはコードを出力する能力だけでなく、探索、開発、検証を継続的に組み合わせる能力です。
主な特徴
- 五つのプラットフォーム。 Ubuntu、macOS、Windows、Android、Webを対象とし、ネイティブGUI操作とコーディングツールを統合した共通ハーネスを提供します。
- 参照アプリを判定基準に利用。 動作中の参照を使って隠れた挙動テストと実行結果に基づく報酬を構成します。見た目だけ整ったコードでは十分ではありません。
- オープンソースアプリで軌跡を拡張。 高品質なオープンソースアプリケーションを用いて訓練軌跡を生成し、復刻以外のタスクへの転移も調べます。
- プログラムと視覚の両面を評価。 RecreationBenchは複数分野・複数プラットフォームの250タスクで構成され、異なる操作の深さにおける状態変化をプログラム上のアサーションと視覚的アサーションで確認します。
明らかになった限界
報告された評価では、GPT-6 Astraが総合58.1%で首位でした。一方、すべてのプログラムテストに合格したタスクは2.8%だけです。この差は、画面が似ていることと、アプリケーションの挙動が再現されていることが別問題であることを示します。エージェントは静的なインターフェース構造を比較的再現しやすいものの、インタラクションや計算結果では不安定です。生成されたアプリケーションも、参照より小規模で、単一構造にまとまりやすい傾向があります。
関連する軌跡で訓練したモデルは、五つの分布外コーディング・ハイブリッド操作ベンチマークで改善し、描画結果を確認する頻度も高まりました。検証行動が別の課題へ移る可能性を示す結果ですが、複雑なソフトウェアの再現が解決したことを意味するものではありません。
意義
RecreationWorldは、単発のクリックやコード生成ではなく、「観察、実装、実行、検証」という作業ループを評価の中心に置きます。エージェントの信頼性を測るには、最終画面や一つの操作の成功だけでなく、状態変化、連続操作、計算出力まで参照と一致しているかを確認する必要があります。
環境、ベンチマーク、テストスイートの公開により、異なるOSやアプリケーションをまたいだ比較も進めやすくなります。今後のコンピューター操作研究では、流暢に操作できることに加えて、意図した挙動を再現できたと検証できることが重要になりそうです。
コメント
ログイン状態を確認中…
コメントを読み込み中…