WebFovea:モデルは正しいのにクリックがずれる理由
導入
視覚ベースのウェブエージェントに必要なのは、画面を理解して次の操作を選ぶ能力だけではありません。モデルの判断をブラウザ操作へ正しく変換し、操作が実際に反映されたかを確認し、その結果を再びモデルへ正確に伝える必要があります。WebFoveaは、このモデルとライブウェブサイトの間にある往復処理に焦点を当てました。
WebFoveaはWebRetriever Challenge 2026で2位に入り、最終スコアは57.0/100でした。この競技のProtocol IIIでは、エントリーURLから出発し、サイト本来のインターフェースを使って、検証可能な回答を返すことが求められます。4回の提出では同じモデルを使っており、31.0から57.0への向上は主にハーネスの変更を反映します。ただし、ライブサイト上の実行には変動もあり得ます。
主な発見
- 解析の失敗は判断を壊す:出力処理が不十分だと、モデルが生成したチャットテンプレートの特殊トークンが通常の文字列として検索欄に入力されます。こうした問題は4.9%のエピソードで確認されました。
- 座標系の整合性が必要:座標空間の不一致により、クリックが意図位置の4分の3の場所に着地しました。スクリーンショットを基盤とするエージェントでは、わずかな変換ミスが後続操作全体を崩します。
- ウェブ部品は静かに失敗する:ネイティブのドロップダウン、iframe内部、テキストボックスは、共通のクリックやキー入力で常に操作できるとは限りません。失敗検知がなければ、存在しない状態を前提に計画を続けてしまいます。
- フィードバックは実際の変化を伝えるべき:あるiframe内のクリックは成功したのに、ハーネスは変化なしと報告しました。その結果、モデルは正しい経路を放棄しました。
- 観察は静止画だけでは足りない:ホバー時にだけ表示される値もあります。瞬間的な状態を取得できなければ、完了に必要な情報がモデルから見えなくなります。
WebFoveaはこの4段階をそれぞれ強化し、ルールや予算の範囲内に操作を収めるガードレールも加えました。4段階という見方は特定のモデルに依存しませんが、個々の対策にはモデルやブラウザ環境への依存があります。
意義と影響
この研究は、ウェブエージェントの信頼性を純粋な推論能力の問題から、システム全体の問題へと捉え直します。実際のサイトには不統一な操作部品、変化するレイアウト、埋め込みコンテンツがあり、途中のエラーは正しい判断であっても推論の失敗に見えてしまいます。
研究者にとっては、エラーの原因をより細かく分類し、モデル能力とツールチェーンの能力を分離して評価する枠組みになります。開発者にとっては、座標の校正、出力のサニタイズ、操作失敗の検出、iframe対応、状態遷移の検証が実用上の優先課題になります。大きなモデルへ交換するだけではなく、正しい意図をブラウザとの往復全体で保持することが、信頼できるエージェントの条件です。
コメント
ログイン状態を確認中…
コメントを読み込み中…