Marathoner:让智能体从短跑走向超长程执行
导语
当前许多 AI 智能体已经能够调用工具、编写代码或执行多步流程,但“能开始”并不等于“能坚持完成”。任务一旦持续数小时,模型就可能偏离目标、重复操作,或在接近终点时停止推进。来自蚂蚁集团的研究团队提出 Marathoner,关注的正是这种超长程执行能力:让智能体围绕一个复杂目标持续规划、行动和修正,而不是只完成若干局部步骤。
核心方法
Marathoner 并非单一模型结构,而是一套围绕长程任务设计的后训练流程。
- 从真实软件工程变更中合成任务。 研究者选取 GitHub 上包含 1000 行以上新增代码的主要版本发布 PR,作为构造复杂任务的基础。相比简单问答或短代码题,这类素材天然包含更长的依赖链、更多潜在错误以及更明确的最终目标。
- 通过多任务串联提高难度。 系统把多个生成任务连接起来,形成更长、更复杂的连续任务,使训练数据接近前沿级别的执行挑战。
- 先用拒绝采样进行冷启动。 研究者借助较强的教师模型和多种执行 harness 生成候选轨迹,再筛选有效轨迹对基础模型进行监督微调,为后续强化学习提供起点。
- 在独立沙盒中进行强化学习。 冷启动后的模型需要在隔离环境中真实执行任务,而不是只根据静态文本学习。这样的 rollout 能让模型接触工具调用、错误恢复和中间状态变化。
- 引入后期奖励。 Later Stage Bonus Reward 专门鼓励模型在执行后半段继续完成有意义的操作,缓解智能体“前期表现积极、后期逐渐停摆”的问题。
结果与意义
论文在五个包含超长程任务的基准上进行评估,报告称 Marathoner 相较基础模型取得稳定且明显的性能提升,并超过了强 proprietary 模型。进一步分析显示,在高难度任务中,模型可以持续工作 10 小时以上,并完成 1000 次以上工具调用。素材没有披露这些基准的具体名称、各项得分或比较模型的完整配置,因此这些结果仍需要结合论文全文和可复现实验进一步判断。
这项工作的价值不只在于延长单次运行时间,更在于把“长期坚持”转化为可训练、可评估的智能体能力。以大规模代码变更构造任务,能够让训练目标更接近真实软件工程;沙盒执行则把模型从文本推理带入动态环境;后期奖励则针对长程任务中常见的阶段性退化提出了明确干预。
不过,持续调用工具并不自动意味着真正理解长期目标。超长轨迹也可能放大错误、增加计算成本,并带来状态管理和结果验证问题。Marathoner 提供的是一条训练路径,而不是对通用自主性的最终证明。未来仍需观察其在非编程任务、开放环境和更严格的可靠性评估中的表现。
评论
正在确认登录状态……
正在加载评论……