X-Tree:把可复用经验变成智能体训练中的“词汇表”
导语
多步智能体往往不是不会执行单个动作,而是难以把一次任务中学到的操作程序迁移到另一项任务。现有 SFT 和强化学习通常将轨迹展开成动作流,对每个 token 或动作近似等权处理。这样一来,“填写两个字段并提交”“前往厨房拿取温度计”这类反复出现的程序,会在不同任务中被重复学习,历史经验的结构价值没有真正进入模型参数。
X-Tree 的核心思路,是从已有轨迹中恢复这套隐藏的层级结构,并把它直接用于训练。论文作者将其称为可复用经验树(Reusable eXperience Tree)。
核心方法:像构建词表一样挖掘技能
X-Tree 没有依赖 LLM 自动撰写技能说明,而是采用类似子词分词器的统计合并方法。首先,研究者对原始动作进行规范化:将动作类型保留为可比较的符号,例如“输入日期”或“点击按钮”,同时把页面元素 ID 和具体值放入槽位。这样,不同网站上的相似操作就能被识别为同一类行为。
随后,系统评估相邻动作片段的复用价值。评分不仅考虑片段出现的频率,还纳入合并后跨度的长度,以及它在成功轨迹中的出现情况。只有在压缩轨迹、降低重复表达的收益超过额外成本时,动作才会被合并。不断合并后,短动作组成更高层的程序,最终形成一棵经验树。
例如,填写两个字段并提交可以成为一个可复用节点;它再与前置导航动作组合,形成“按日期范围筛选表格”这样的更高层程序。该过程是确定性的、可审计的,也不需要额外的模型调用。
三种训练用法
论文将 X-Tree 接入了三类训练设置:
- 离线强化学习:把树中的节点作为独立训练实例,使模型直接学习程序级经验,而不只是连续动作。
- 在线 RLVR:根据智能体是否完成或使用有价值的技能,提供自适应的技能奖励,强化可迁移的行为片段。
- 在策略自蒸馏:把经验树作为教师模型可见的特权上下文,帮助学生模型从轨迹中提炼更高层的行为结构。
这种设计也区别于只在上下文中提供 LLM 编写技能的方案。后者可以帮助当前推理,但技能未必进入模型权重,离开检索或提示后也不一定能够泛化。X-Tree 则试图让经验结构成为训练信号的一部分。
实验结果与意义
在 WebArena、ScienceWorld 和 WebShop 上,研究者以不同模型规模进行评测,并在匹配数据量和训练预算的条件下与标准训练方案比较。结果显示,X-Tree 最多带来 WebArena 4.5 个百分点的成功率提升、ScienceWorld 5.8 个百分点的成功率提升,以及 WebShop 4.1 个百分点的成功率提升。对照分析认为,收益主要来自经验树本身及其在三种训练方式中的结合,而不只是增加训练上下文。
这项工作的意义在于,它把“技能复用”从人工提示工程转化成了可由数据自动发现的训练对象。对于昂贵、稀缺的智能体轨迹,程序级切分能够提高单条经验的利用率,也为离线数据整理、奖励设计和长期能力迁移提供了统一接口。当然,X-Tree 的效果仍依赖动作规范化和成功轨迹的质量;如何处理高度依赖页面语境、难以抽象的动作,仍是这类方法需要继续解决的问题。
评论
正在确认登录状态……
正在加载评论……