EvoSkill-GUI、GUIエージェントの技能を実行中に進化させる
はじめに
GUIエージェントにとって、長いタスクの難しさは単純なクリック操作そのものではない。実行中に画面の状態が変わり続けることが問題になる。ポップアップが割り込み、ページの読み込みが遅れ、ボタンやウィジェットの位置が変われば、開始前には正しかった手順も機能しなくなる。
従来のスキルフレームワークは、成功した手順を再利用可能な知識として保存することで、この問題に対応してきた。しかし多くの場合、スキルはデプロイ前に作られ、運用開始後は固定された成果物として扱われる。EvoSkill-GUIは、実行によって見つかった弱点を反映できる「生きた手続き知識」としてスキルを捉え直す。
主な仕組み
- 複数ファイルで技能を構成:各スキルには検索用メタデータ、実行可能な計画、代替ローカライズ手段、失敗回復ルール、アクセシビリティ用ツール、失敗事例を含める。知識を役割ごとに分けることで、実行の段階に応じた利用を可能にする。
- ロールアウト中に即時修正:実際の画面が予想と異なる場合、実行器は元の計画を機械的に続けるのではなく、その場で経路を修正する。
- 失敗診断を分離:独立した批評器が、厳格な情報分離の下で失敗した軌跡を調べる。実行時には得られない情報に頼った診断を避けることが狙いだ。
- 更新範囲を制限:実行器は制限付きツールインターフェースを通じて、必要な技能ファイルだけを編集する。既存の有効な手順を残しながら、具体的な回避策や回復規則を追加する設計である。
評価と意義
論文では、モバイルとデスクトップの両方を含むMobileWorld、AndroidWorld、OSWorldで評価を行った。著者らによれば、EvoSkill-GUIは追加学習を行わずに複数の基盤モデルの性能を改善した。報告された最大改善幅は、3つのベンチマークでそれぞれ16.2%、6.0%、10.5%である。
この結果が示す大きな意味は、エージェントの記憶を固定された操作マニュアルとしてではなく、実行経験の記録として設計できる点にある。失敗した試行から、別の位置特定方法、復旧手順、注意事項を抽出できれば、次の類似タスクで再利用できる。画面構成やタイミングを静的なワークフローだけで表しにくいソフトウェア環境では、特に有効な考え方だろう。
一方で、誤った診断が不正確な規則として蓄積される可能性は残る。したがって重要なのは、単に自己編集を許すことではなく、診断の分離と編集権限の制約を組み合わせることだ。EvoSkill-GUIは、モデルを再訓練する代わりに、利用中の失敗を次の実行に役立つ技能へ変換する道筋を示している。
コメント
ログイン状態を確認中…
コメントを読み込み中…