T1:让终端智能体在长任务中学会持续行动
导语
当 AI 智能体从回答问题转向编写代码、配置环境和完成科研流程时,真正的难点不再是生成一段看似合理的文本,而是在数十乃至数百次操作中持续保持目标、修正错误,并最终让任务通过自动验证。腾讯混元团队提出的 T1,正是针对这类长时程终端任务训练的模型。
T1 解决什么问题?
T1 是一个总规模为 1220 亿参数的混合专家(MoE)模型。它不会只在静态数据上预测下一词,而是在云端沙箱中使用真实 Shell,执行命令、读取结果、修改文件,并根据任务自带的验证器判断是否完成。单个任务最多支持 300 多轮工具调用,这使训练环境更接近实际编码和系统操作场景。
研究团队采用强化学习,让模型从可验证的结果中学习。与仅在任务结束时给出成功或失败不同,T1 使用过程奖励,根据轨迹中通过的验证器数量进行更密集的评分。这样,模型即使尚未完全完成任务,也能从局部进展中获得反馈。
训练稳定性是关键
长轨迹智能体训练的一个核心问题,是采样阶段和参数更新阶段可能使用了不同的 token 或路由决策,导致训练信号失真。T1 的方案包含三部分:
- 强化学习预热:先进行更充分的初始化,降低 actor-critic 训练初期的不稳定性。
- TITO 构建:训练时使用采样过程中实际产生的 token 标识,并在多轮交互边界进行漂移修复。
- R3 路由回放:记录 MoE 模型在采样时每个 token、每一层所选择的专家,训练时重放这些路由。
论文报告称,TITO 与 R3 将训练和推理之间的对数概率差异从 0.021 降至 0.013,并在损失计算区域实现零 token 漂移。这些工程细节说明,长时程强化学习的瓶颈不仅在奖励设计,也在于能否准确复现智能体实际走过的轨迹。
结果与意义
为了避免模型只记住测试集,研究使用与 Terminal-Bench 2.1 隔离的种子和合成任务构建训练语料。根据论文数据,后训练流程将基础模型在 Terminal-Bench 2.1 上的解决率从 43.8% 提升到 64.0%;在更强调长任务能力的 Long-Horizon Terminal Bench 上,T1 达到 27.9%,并超过论文所列的 GPT-5.4 与 GLM-5.1。
T1 的价值在于提供了一套面向终端智能体的训练范式:用真实执行环境替代纯文本反馈,用验证器连接奖励与任务结果,再通过轨迹和 MoE 路由对齐提升优化稳定性。它并不意味着长任务已经被彻底解决,但显示出,智能体能力的提升可能更多依赖可靠的交互式训练基础设施,而不只是继续扩大模型规模。未来,这类方法能否迁移到更复杂的软件工程和科研工作流,还需要更多公开评测验证。
评论
正在确认登录状态……
正在加载评论……