DeskForge、制御可能なデスクトップ環境でPC操作エージェントを学習
導入
PCを操作するエージェントにとって、指示の意味を理解することだけでは不十分だ。複数のアプリ、重なったウィンドウ、見た目の似たボタンが同時に表示される画面では、次に操作すべき対象を正確に特定しなければならない。DeskForgeは、この課題に対して、静的なスクリーンショットだけでなく、状態を制御できるデスクトップ環境から学習データを生成する方法を提案する。
主な仕組み
- 実アプリを使った制御可能な生成。 DeskForgeは実際のデスクトップアプリを組み合わせ、アプリの状態や内容、ウィンドウ配置、見た目、解像度を変化させる。実ソフトウェア特有の複雑さを保ちながら、難しい条件を体系的に作れる点が特徴だ。
- 複数情報源による密な注釈。 スクリーンショットにアクセシビリティツリーとウィンドウの幾何情報を統合し、画面内の要素と位置を詳しく記録する。最終的なクリック点だけを与えるデータより、多くの操作候補を表現できる。
- 操作結果も記録。 エージェントが実行した各アクションと、その結果を保存するため、画面を見て対象を選ぶ段階と、実際に操作が成功したかを結び付けられる。
- 大規模なデータセット。 DeskForge-1Mは120万件の注釈付きデスクトップ観測と、1億5970万件の要素インスタンスで構成される。論文では、そのうち20万件のgrounding例を使って4つの視覚言語モデルを微調整した。
- 外部評価でも改善。 論文によれば、4モデルすべてが未学習のデスクトップ条件と5つの外部GUI groundingベンチマークで改善した。Qwen3.5-4BではScreenSpot-Proが11.51ポイント、OSWorld-Gが10.11ポイント上昇している。
意義と限界
DeskForgeの重要性は、単にデータを増やしたことではなく、デスクトップ操作の難しい条件を制御可能にした点にある。人手で集めたデモや単独の画面画像だけでは、ウィンドウの遮蔽、レイアウトの変更、解像度の差、似たコントロールの競合を十分に組み合わせるのは難しい。アプリ状態と画面構造を操作できれば、エージェントが失敗しやすい状況を狙って生成できる。
効果は単発の対象特定にとどまらない。固定したプランナーの下で、DeskForgeで微調整したモデルは、WebArena-InfinityとOpenAppsの長期タスクでも多くの課題を解いた。Qwen3.5-4Bは前者で119件中31件から50件へ、後者で100件中3件から15件へ増加した。各ステップの位置特定が改善すると、長い操作列全体の成功率にも波及する可能性を示している。
一方で、これは提案されたデータ生成・学習手法の有効性を示す結果であり、PC操作エージェントの信頼性が解決済みという意味ではない。アプリのバージョン変更や予期しない状態、複数アプリをまたぐ処理は依然として分布のずれを生む可能性がある。コード、データセット、微調整済みモデルの公開は、今後の再現実験と手法比較に役立つだろう。
コメント
ログイン状態を確認中…
コメントを読み込み中…