返回文章列表
AI 智能体

VibeLifeBench:把生活助理放进会变化的长期世界

阅读约 2 分钟

导语

个人 AI 助理正在从“回答问题”走向“替人办事”,但现有评测大多仍停留在短指令、静态沙盒和明确目标上。VibeLifeBench 提出的关键问题是:如果一个任务持续数周,环境在没人提醒时持续变化,很多限制条件也从未被直接说出口,当前智能体还能可靠地完成生活事务吗?

核心要点

  • 任务不再只是一个提示词,而是一个带时钟的世界。 VibeLifeBench 包含 200 个长周期任务,覆盖十类日常生活领域。每个任务都被设计成多周时间线,中位持续 29 天,并运行在包含 22 个模拟服务、288 个工具的环境中。
  • 世界会“静默变化”。 基准中设置了 1,483 次静默状态变更,例如座位被悄悄作废、航班延误、钓鱼邮件进入邮箱等。这些事件不会主动通知智能体,只有它定期重新检查环境,才可能发现问题。
  • 隐含约束被纳入评分。 现实生活里,许多关键限制并不会以 API 字段或清晰指令形式出现,例如护照有效期是否满足六个月规则、携带胰岛素是否需要海关证明、预算上限如何约束后续选择等。VibeLifeBench 会检查智能体是否真正遵守这些未明说条件。
  • 评分只看留下的结果。 该基准设计了 12,261 个加权检查项,覆盖最终状态、行动时机和约束遵守情况。评测不读取模型隐藏推理,而是依据智能体实际在环境中留下的痕迹打分。

结果与影响

论文材料显示,七个前沿模型在该基准上整体表现都不高。最佳模型 Claude Opus 5 的 avg@3 为 32.5,并且所有模型都会从时间线前段到后段下降 10 到 15 分。在一个 20 天日本旅行任务中,没有任何一次运行拒绝了钓鱼邮件,这暴露了长期情境下安全警觉与计划维护的薄弱环节。

VibeLifeBench 的价值不只是给模型排名,而是重新定义“生活智能体”应被怎样测试。真实助理需要知道何时主动行动、何时提问、何时保持沉默,还要在没有提示的情况下发现新情况,并把最初计划坚持到最后。单轮工具调用的流畅度并不能自动转化为长周期可靠性。随着任务、环境和评测框架计划开源,这类基准可能推动智能体研究从短期执行,走向更接近现实的持续代理能力。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章