CaSKG:用反事实因果校准提升智能体技能检索
导语
让大语言模型智能体学会“做事”,不只是保存若干成功案例,还要在新任务出现时找出正确的技能,并按照合理顺序组合起来。技能库越大,覆盖面越广,但检索难度和上下文成本也随之上升。CaSKG(Counterfactual-Causal Skill Graphs)关注的正是这个瓶颈:如何判断两个技能之间的关系,是否真的有助于完成任务,而不仅仅是文字上相似。
核心方法
传统的全库提示可以保留更多候选技能,却会消耗大量上下文;向量检索更紧凑,但通常把技能看成相互独立的文本;图检索能够补充工作流上下文,却依赖可靠的图边。CaSKG将重点放在“边的可信度校准”上,流程主要分为两步:
- 先构建高召回候选图。 系统综合语义相似度、词汇线索、技能输入输出关系和结构信息,生成带方向的候选边;修复证据以及可选的LLM评审器,还可用于进一步调整候选分数。
- 再用反事实探针检验关系。 对技能对进行删除、替换和顺序重排,观察文本层面的程序性证据是否支持某个方向的依赖关系。不同探针的结果经过贝叶斯平滑聚合,最终形成带权重、并经过状态过滤的技能图谱。
- 离线校准,在线扩展。 图谱在离线阶段构建,运行时根据当前任务和状态进行技能扩展,不改变下游智能体的策略或任务接口。
这种设计的关键,不是单纯增加图结构,而是尝试区分“看起来相关”和“在执行流程中真正有用”的关系。例如,前置条件、改变环境状态的动作、验证步骤和最终完成动作,都可能通过方向化的边获得更清晰的表达。
实验结果与意义
论文在ALFWorld ID-140和ScienceWorld U211上,使用六种LLM骨干模型进行评估。作者报告称,CaSKG在两个基准的十二种模型—任务组合中都取得最高任务得分。与Graph-of-Skills相比,六模型宏平均的ScienceWorld得分从72.62提升至80.50,ALFWorld成功率从80.01%提升至86.79%,同时两个基准上的平均环境步数也有所下降。定性分析和消融实验进一步显示,经校准的图边有助于检索结果保留前置条件、状态变更、验证和收尾步骤。
这项工作的价值在于,它把智能体记忆检索中的一个常被忽略的问题单独抽取出来:技能之间的连接质量,可能比技能数量本身更决定检索结果能否执行。对于需要多步操作的家居任务、科学实验流程或工具调用场景,可靠的方向关系有望减少无效技能、缺失前置步骤和顺序错误。
不过,现有结论仍主要来自论文所报告的两个基准和离线构图流程。反事实文本探针能否稳定反映真实环境中的因果依赖,以及图谱在开放世界、技能持续变化时的维护成本,还需要更多任务和长期运行实验验证。总体而言,CaSKG提供了一条不改动智能体策略、而从记忆组织层面提升可执行检索的路线。
评论
正在确认登录状态……
正在加载评论……