WebFovea:当模型判断正确,网页点击却错了
导语
让 AI 在真实网站上完成搜索、筛选和信息提取,难点并不只是“看懂页面并做出判断”。视觉网页智能体还必须把模型输出准确转换为浏览器动作,确认动作确实生效,再把页面变化正确反馈给模型。WebFovea 关注的正是这条容易被忽视的闭环。
这项工作参加了 WebRetriever Challenge 2026,在要求智能体从入口网址出发、使用网站自身界面并返回可验证答案的 Protocol III 任务中取得第二名,最终得分为 57.0/100。研究团队在四次提交中使用了同一个模型,因此从 31.0 到 57.0 的变化,主要反映了交互 harness 的改进,同时也可能受到真实网站运行波动的影响。
核心要点
- 解析不等于执行:模型可能已经生成了正确意图,但输出解析器若处理不当,聊天模板中的特殊标记会被当成普通文本输入搜索框。团队记录到,这类问题影响了 4.9% 的任务回合。
- 坐标空间必须一致:一次坐标映射问题让点击位置落在目标位置的四分之三处。对依赖截图和坐标的代理来说,微小的空间转换错误可能导致连续操作全部偏离。
- 网页控件存在“静默失败”:原生下拉菜单、iframe 内元素和文本框并不总能通过统一的点击或键盘接口操作成功。若执行层没有识别失败,模型就会基于错误状态继续规划。
- 反馈必须描述真实变化:某次 iframe 内的点击实际生效,却被系统报告为“没有变化”,导致模型放弃了正确路径。
- 观察不仅是截图:有些信息只有在悬停后才出现。若观察机制只提供静态页面状态,模型可能根本看不到完成任务所需的内容。
WebFovea 围绕这四个阶段加固了模型与浏览器之间的往返过程,并加入限制行动范围和预算的护栏。其关键观点是:解析、执行、反馈、观察构成了一套与具体模型相对独立的诊断框架,尽管其中某些修复仍依赖具体模型或网页环境。
意义与影响
这项工作把网页智能体的可靠性问题从“模型是否足够聪明”扩展为“整个闭环是否可信”。在真实网站上,页面结构会变化,控件行为也不统一,任何一个中间环节的错误都可能被误判为推理失败。因而,单纯更换更大的多模态模型,未必能解决实际部署中的大量故障。
对研究者而言,四阶段划分提供了更细的错误归因方式,也提醒评测者区分模型能力与工具链能力。对产品开发者而言,动作确认、失败检测、iframe 处理、坐标校准以及输出清洗,可能比增加一轮自由形式的模型思考更直接地提升成功率。WebFovea 还提出未来可让不同模型负责不同步骤,但现有结果首先证明了一个更基础的事实:可靠的网页代理不仅要“想对”,还要确保每一次往返都没有把正确意图丢在路上。
评论
正在确认登录状态……
正在加载评论……