記事一覧へ戻る
世界モデル

AutoGUIWorld、画像生成モデルでGUIエージェントの世界をシミュレーション

読了目安 3 分

はじめに

GUIエージェントが実用的なタスクをこなすには、ボタンの位置を見つけてクリックするだけでは不十分だ。操作後に何が変わったのかを把握し、複数の手順にわたって状態を維持しながら、次の行動を選ばなければならない。この能力を学習させるには、実際のアプリケーション上で記録した操作軌跡が有効だが、アプリのインストール、設定、実行環境の維持には大きなコストが伴う。対象ソフトや画面状態、ワークフローの種類も、利用できる環境に制約される。

AutoGUIWorldはこの問題に対し、画像生成モデルを視覚的なワールドモデルとして利用する。つまり、ソフトウェアを実際に動かす代わりに、操作後の画面を生成してGUIの遷移を再現する。

仕組みの要点

  • 初期画面を仕様から作る。 OSの文脈、見た目、UIの状態を構造化して記述し、その条件に合うGUIシーンをサンプリングする。
  • プランナーが手順を設計する。 タスクを原子的な操作に分解し、各操作によって画面上で何が変わるべきかも指定する。単なるクリック座標ではなく、操作と状態変化を結び付ける設計だ。
  • 画像生成モデルが画面を更新する。 現在のスクリーンショットを段階的に編集し、次の観測画面を生成することで、多段階の操作軌跡を構成する。
  • 対応付けと品質確認を行う。 アクションのgroundingと遷移単位のフィルタリングを使い、空間情報を持つステップ単位のサンプルを選別する。報告されたデータはUbuntu、Windows、macOS、Chromeを対象とする79,266件である。

結果と意義

研究では、AutoGUIWorldの軌跡を用いてQwen3.5-35B-A3Bを微調整した。OSWorldの平均タスクスコアは33.0%から40.8%へ、ScienceBoardのタスク成功率は14.0%から32.2%へ上昇した。合成された視覚的遷移が、操作、画面の変化、タスク状態の関係を学ぶための監督信号になり得ることを示している。

この手法の意義は、GUIデータの生成を「ソフトウェアを実行する作業」から一部切り離した点にある。実行が難しい専門アプリや、構築コストの高い環境についても、画面の条件と遷移を定義することでデータを増やせる可能性がある。また、複数OSを横断したデータ作成を統一しやすくなる。

残る課題

見た目が自然な画面を生成できても、それが実際のアプリケーションの内部ロジックまで再現するとは限らない。権限エラー、読み込み遅延、予期しないダイアログ、長期的な状態の整合性などは、画像だけでは捉えにくい。したがって、AutoGUIWorldは実環境のデータや評価を置き換えるものというより、補完する手段と見るのが妥当だろう。生成された遷移を実際のソフトウェア挙動とどのように校正するかが、今後の重要な論点になる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Physis-Lang:進化する物理言語で動画世界モデルを改善
世界モデル
cctest.ai
世界モデル

Physis-Lang:進化する物理言語で動画世界モデルを改善

NVIDIAの研究チームは、物体や因果関係、相互作用、時間変化を記述する物理言語を、動画の収集・学習・生成に共通する表現として扱うPhysis-Langを提案しました。原子レベルの断言評価と言語誘導検索により、物理的に妥当な動画生成を目指します。

続きを読む
CCTest · Blog
世界行動モデルの汎化を支えるのは「未来の完全生成」ではない
世界モデル
cctest.ai
世界モデル

世界行動モデルの汎化を支えるのは「未来の完全生成」ではない

新しい実証研究は、世界行動モデルが推論時に未来動画を最後まで生成しなくても、汎化性能の利点を維持できる可能性を示した。重要なのは、行動を決める前に未来表現を準備することだという。

続きを読む