返回文章列表
AI 智能体

MintAct:把视觉智能体训练从单项能力推进到统一交互

阅读约 2 分钟

导语

数字世界中的智能体往往不是只完成一种任务:它既要看懂按钮和窗口的位置,也要根据目标连续操作,还可能需要调用视觉工具。现有方案常按移动端、桌面端或网页场景分别训练,专用模型在单一领域更容易优化,但跨环境迁移和维护成本也随之增加。论文提出的 MintAct,尝试用一套视觉语言模型覆盖这些能力。

核心要点

  • 统一多类交互能力。 MintAct 将 UI grounding、多步导航和视觉工具使用放入同一模型体系,并提供 2B、4B、8B 三种规模。
  • 训练环境覆盖多个数字平台。 研究团队搭建了面向移动端、桌面端和网页的异构后端,并同时支持轨迹数据收集和在线强化学习。
  • 强调训练分布的可控性。 异步框架能够显式管理不同领域在训练中的比例,避免某一类环境过度主导学习过程。
  • 面向真实训练噪声。 该框架被设计为在环境反馈不稳定、数据分布发生离策略偏移时保持训练稳定。
  • 基准结果显示竞争力。 论文报告 MintAct 在 OSWorld-Verified 上达到 48.9 分,并称其在一系列基准中取得同规模下的先进表现。

为什么值得关注

MintAct 的价值并不只是把几个任务名称放在同一个模型里。对视觉智能体而言,真正困难的部分通常出现在训练闭环:环境如何批量启动,轨迹如何持续产生,来自不同平台的反馈如何被混合,以及在线强化学习如何避免被滞后或噪声数据带偏。论文把相当篇幅放在这些基础设施问题上,说明通用智能体的瓶颈可能已经从“能否识别界面”扩展到“能否稳定地在大量异构环境中学习”。

如果这种统一训练思路能够在更多任务上保持效果,开发者或许可以减少为每种设备单独维护模型的需要,并让模型在不同数字环境之间共享操作经验。不过,当前素材主要提供摘要和单项基准成绩,尚不足以判断各领域的具体提升幅度、训练成本、失败类型或真实部署稳定性。MintAct 更适合作为跨环境视觉智能体训练范式的阶段性信号,而不是对所有数字操作场景已经成熟的证明。

Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
RecreationWorld:让计算机使用代理在真实软件复刻中学会探索、编程与验证
AI 智能体
cctest.ai
AI 智能体

RecreationWorld:让计算机使用代理在真实软件复刻中学会探索、编程与验证

RecreationWorld提出了一套面向混合型计算机使用代理的训练与评测框架,让代理从可运行的参考软件出发,自主探索界面、编写实现并验证结果。其配套基准覆盖五类平台和250项任务,显示代理仍明显擅长静态界面复现,而不擅长复杂交互与计算逻辑。

阅读全文