TraceDance:从真实部署轨迹自动生成智能体行为基准
导语
智能体完成任务,并不意味着它在执行过程中始终表现良好。它可能越权调用工具、忽略关键约束、在决策点采取不安全或不合适的行动。传统基准通常预先定义任务和答案,难以覆盖部署后才出现的细分行为问题。ByteDance等研究者提出的 TraceDance,试图把真实运行轨迹直接变成面向特定问题的行为测试集。
核心方法
TraceDance的输入是智能体在编码和通用工具使用场景中的部署记录,以及开发者希望检查的“不良行为”。系统主要通过三步完成构建:
- Anchor-and-Confirm:先利用可编程检索从大量轨迹中找出可能相关的片段,再由一个 Flash LLM 对候选片段逐一确认,降低纯关键词检索带来的误报。
- Anchor Synthesis Loop:当目标行为缺少明确规则时,系统生成行为规范,并根据检索和确认结果持续修改,使测试目标逐渐具体化。
- 决策点续接评测:测试并不重放完整环境,也不要求预设唯一正确答案,而是截取轨迹中的关键决策点,让待测模型继续生成下一轮响应,再依据行为专属评分标准判断其是否合格。
这种设计把评测重点从“任务是否完成”转向“模型是如何完成任务的”。因此,即使原始智能体最终得到了正确结果,其中途的风险行为也可能被单独识别出来。
实验结果
研究使用了252,557次会话,生成107个行为基准和4,125个实例,95.3%的目标构建请求得以完成。在抽样检查中,两位人工标注者确认84%的实例确实体现了所要求的行为。自动评分器与人工对通过或失败的判断,其一致性接近人工标注者彼此之间的一致性,说明自动化评测具备一定可用性,但并不意味着它已经取代人工审查。
在9个前沿大语言模型上的测试中,平均通过率只有26.7%。这个结果表明,当前模型即使具备较强的通用任务能力,在具体决策点上仍可能无法稳定遵守行为规范。需要注意的是,该数字衡量的是这些定向基准上的行为通过情况,不能直接等同于模型整体能力排名。
意义与局限
TraceDance的价值在于形成一条“部署问题—定向基准—模型改进”的闭环。开发者不必等待固定榜单更新,而可以围绕实际事故、投诉或观察到的风险快速生成测试,从而支持更细粒度的回归评测,也为递归自我改进流程提供可能的测试组件。
不过,系统质量仍取决于原始轨迹的覆盖范围、行为规范的清晰度以及自动评分器的可靠性。84%的人工确认率也说明,检索和规范生成并非完全准确。未来若要将这类方法用于高风险场景,还需要更广泛的人工复核、跨任务验证和对评测偏差的持续分析。
评论
正在确认登录状态……
正在加载评论……