微软 Echoverse:让电脑操作智能体在“会变化的应用”里训练
导语
电脑操作智能体要真正学会使用软件,不能只看截图或阅读说明文档。它需要在应用里点击、输入、提交、犯错,再根据状态变化获得反馈。但现实中最有价值的应用往往需要登录、包含私人数据、状态复杂且难以反复重置,因此研究者通常会构建合成环境来替代真实网站。
微软研究院的 Echoverse 试图回答一个更进一步的问题:当“环境数量”不再是唯一瓶颈时,什么样的训练环境才真正有用?论文给出的答案是:环境必须足够深、必须针对模型真实失败的交互能力,并且要能随着模型训练不断被修补和演化。
核心要点
- 从规格生成有状态应用:Echoverse 将环境规格编译成可交互应用,应用内部有数据库和状态变化,而不是只有表面 UI。
- 用应用自身数据库评分:任务是否完成不只依赖外部文字判断,而是通过应用数据库中的真实状态进行验证,例如记录是否被创建、修改或删除。
- 一次 rollout,两种用途:每次带评分的智能体执行轨迹,既被用来修复环境、任务和验证器,也被用作模型训练信号。
- 强调“深度”而非“外观”:论文发现,浅层环境甚至可能让模型在真实站点上的准确率低于基础模型;而具备行为深度的环境能带来正向迁移。
- 可服务于强化学习:这些世界也可作为强化学习环境,结合 grounded verifier 与逐步密集评审奖励后,保留任务得分从 58.8% 提升到 68.0%。
关键结果
论文报告称,在 12 个 Echoverse 环境上训练后,一个 9B 模型在 14 个评测划分上的表现从 36.5% 提升到 67.1%,距离用于教学的更大前沿模型相差 14 个百分点以内。更值得注意的是,研究并不只展示总分提升,而是拆解了提升来自哪里。
在相同领域中,浅层环境让 live-site accuracy 从 80.0 降到 75.0;而深层环境可将其从 80.0 提升到 85.0,并在另一个设置中从 48.0 提升到 65.0。针对一个界面控件在多种渲染方式下反复训练,也能迁移到未见过的组件族和开放网络。单个环境经过修复后,用它训练的模型表现从 16.2% 提升到 38.5%。
意义与影响
Echoverse 的价值在于把“电脑使用能力”的训练问题,从单纯扩充数据集转向构建可迭代的交互世界。对于 AI Agent 来说,网页或应用并不是静态文本,而是带状态、带约束、带副作用的系统。若环境只模拟按钮和页面外观,却没有真实业务逻辑,模型可能学到错误的捷径。
这项工作也提示行业:未来 Agent 训练平台的竞争点,可能不只是环境数量,而是环境是否能暴露真实失败模式、是否有可靠验证器、是否能被自动修复。Echoverse 目前还只是研究系统,并且公开了 4 个环境作为基准,但它代表了一条清晰路线:让智能体在更接近真实软件的可控世界里反复练习,再把能力迁移到开放网络。
评论
正在确认登录状态……
正在加载评论……