GUI-HARVEST、実行証拠からGUIエージェントを改善
導入
GUIエージェントは、画面を理解してクリックや入力を行う視覚モデルだけでは成立しません。観察をどのように組み立てるか、モデルの出力をどう実際の操作へ変換するか、成功をどう確認し、失敗後に復旧して、いつ終了するかを決める実行ハーネスが、実用上の性能を大きく左右します。GUI-HARVESTはモデルの重みを更新するのではなく、このハーネス自体を実行経験から改善する方法を提案します。
手法のポイント
GUI環境では、モデルの意図と画面上の結果が簡単に食い違います。正しいボタンを選んだつもりでも、座標のずれ、応答の遅延、予期しないアプリ状態によって、次の画面は計画と異なるかもしれません。GUI-HARVESTは、最終的な成功・失敗だけでなく、具体的な画面遷移を根拠に診断します。
- 操作前後の画面を対応付ける。 モデルの出力と実際に実行された操作を、前後のスクリーンショットと結び付けます。これにより、問題を特定の画面変化に関連付けられます。
- 反復実行を一つの証拠単位として扱う。 同じタスクでも、タイミングや状態、操作結果の違いによって結末が変わります。複数回の比較から、結果に関係する行動上の差分を探します。
- 再発する失敗をコード変更へ変換する。 複数タスクで確認された知見を失敗パターンとして統合し、範囲を制限したソースコード修正に落とし込みます。評価前に期待する挙動を記録し、タスク性能と予測された効果の両方を確認します。
この流れは、観察、原因分析、修正、検証という閉ループを形成します。自由なコード書き換えやプロンプト探索に頼るより、変更の理由と影響を追跡しやすい設計です。
実験結果と意義
OSWorld-Verifiedでの実験では、汎用モデル、GUI特化モデル、プロプライエタリモデルを含む6種類のバックボーンを比較しています。提供された結果では、GUI-HARVESTが示されたすべてのモデル・ステップ予算の組み合わせで最高スコアを達成しました。15ステップでハーネスを最適化し、その後は15、50、100ステップで同じハーネスを評価しています。Qwen3-VL-32B-Instructは初期ハーネスから12.33ポイント改善し、Gemini 3.1 Proは100ステップで79.14%に達しました。
この研究が示すのは、GUIエージェントの改善対象がモデルだけではないという点です。観察情報の整理、操作実行、検証器、復旧処理、終了条件のいずれもボトルネックになり得ます。重みを固定したままランタイムを改善できれば、システム設計の効果を切り分けやすく、あるタスクで得た修正を別のタスクへ再利用する道も開けます。
一方で、スクリーンショットや操作履歴の品質、失敗原因の特定精度、既存能力を損なわない修正の設計が成否を左右します。異なるインターフェースへ修正を移す際の副作用をどう抑えるかも、今後の重要な課題です。
コメント
ログイン状態を確認中…
コメントを読み込み中…