返回文章列表
AI 智能体

Terminal-Universe:把智能体轨迹变成可复用的终端环境

阅读约 3 分钟

导语

终端代码智能体的训练正在从“模仿一条成功轨迹”转向“在环境中反复尝试”。问题在于,现实中的智能体轨迹虽然不断积累,但它们通常只是一次性的操作记录;真正能支持任务重放、执行验证和持续交互的工作环境,仍然稀缺。Qwen团队提出的 Terminal-Universe,试图把两者连接起来:从已有轨迹反推出可运行的工作区,再将一个固定示例转化为可反复探索的任务资源。

核心方法

  • 从操作历史恢复工作区。 系统回放轨迹中记录的文件创建、修改等操作,尽量还原智能体开始修改前的文件状态,由此得到一个部分完整的工作区。
  • 用补全智能体填补缺口。 轨迹往往不会记录所有初始文件、依赖和配置。Terminal-Universe引入补全步骤,补足缺失内容,使恢复出的环境更接近可执行状态。
  • 同时恢复旧任务、生成新任务。 在重建环境上,系统既尝试复原原始意图,也设计与原问题不同的新查询,让同一个环境能够支持更多训练样本和验证过程。
  • 沿广度扩展。 框架挖掘相关环境之间的方向性依赖关系,生成跨工作区、跨代码库的任务。这类任务更接近开发者在真实项目中需要联动多个仓库的工作方式。
  • 沿深度扩展。 单轮请求可以被延展为多轮会话,通过用户智能体模拟反馈、澄清和需求变化,让任务包含持续修正与迭代实现。

结果与意义

研究者将该方法应用于公开的终端智能体轨迹,构建出3.73万个“任务充分”的环境。以这些数据进行监督微调后,Qwen3.5-27B在 Terminal-Bench 2.1 的单轮表现提升11.9个百分点,在 EvoCode-Bench v2 MT@4 的多轮表现提升13.8个百分点。素材并未给出更细的实验设置,因此这些结果应理解为论文报告的总体效果,而不是对所有场景的普遍保证。

这项工作的关键价值,是重新定义了轨迹数据的用途。轨迹不再只是供模型学习的答案示范,也可以充当环境恢复的线索。只要文件变化、工具调用和依赖关系足够完整,一次交互记录就有机会被转化为多个可验证任务,从而提高数据利用率。

对代码智能体而言,广度和深度同样重要。只会处理孤立仓库的模型,未必能完成真实工程中的联调工作;只会一次性响应的模型,也难以应对需求不断变化的开发流程。Terminal-Universe提供了一种数据生产框架,但其效果仍取决于轨迹记录质量、环境恢复准确性以及自动生成任务的验证可靠性。未来,如何避免补全内容与真实项目意图偏离,并建立更严格的任务去重和质量控制机制,将是这一方向继续落地的关键。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
HarnessDev:让大模型自己设计并进化智能体运行框架
AI 智能体
cctest.ai
AI 智能体

HarnessDev:让大模型自己设计并进化智能体运行框架

HarnessDev 将智能体评测的重点从“模型完成了什么任务”推进到“模型能否构建支撑任务的运行基础设施”。结果显示,大模型生成的框架在代码、搜索和研究场景仍落后于成熟的人工作品,但在写作和机器学习实验中已展现出竞争力。

阅读全文