返回文章列表
模型评测

S³Gym:让大模型真正从自测与自评中改进,仍是一道难题

阅读约 3 分钟

导语

大语言模型已经能够在游戏、工具和其他外部环境中持续行动,并积累大量交互轨迹。但“经历过更多事情”并不等于“学会了更好的策略”:智能体是否能主动测试行为、判断结果,再把经验用于下一轮决策,仍缺少细致而统一的评估方式。

论文提出的 S³Gym,正是围绕这一问题设计的交互式基准。它不只观察模型一次行动是否成功,而是把能力拆成三个相互衔接的环节:Self-Testing(自我测试)、Self-Judging(自我判断)和 Self-Improvement(自我改进)。

核心要点

  • 把探索与评测分开。 S³Gym 允许智能体在较宽松的环境中探索,再使用严格的留出任务进行评估,避免模型仅仅记住已经见过的答案或路径。
  • 覆盖七种文本游戏。 每个环境都配有可执行的环境验证器,用于判断行动结果,为经验是否真正改善后续表现提供更明确的依据。
  • 比较三种经验利用方式。 第一种是直接把交互历史放入上下文的 History ICL;第二种是将经验压缩为带有得分信息的 Summary Memory;第三种是通过参数训练,把经验写入模型本身。
  • 改进效果高度依赖任务。 上下文层面的经验在部分模型与游戏组合中有效,但不存在对所有任务都稳定成立的最佳方案。
  • 摘要并非总优于原始记录。 当经验可以归纳为可复用的战略规则时,摘要更有帮助;如果成功依赖精确、随状态变化的信息,保留原始历史反而可能更合适。
  • 参数训练存在双面性。 它在部分任务上带来明显提升,但也可能出现改进不稳定,甚至对其他任务产生严重的负迁移。

意义与影响

S³Gym 的重要性不在于提出一种新的记忆组件,而在于重新定义了“自我改进”应如何被检验。一个模型能够识别哪些行动获得了高分,并不意味着它已经学会了可迁移的策略。真正的改进还要求模型理解成功发生的条件,并在新的状态下正确复用这种理解。

这一结论对智能体系统设计具有直接启发。开发者不能只增加更长的上下文、更多的总结,或简单地进行额外训练,而需要根据任务的信息结构选择经验表示方式:规则性强的任务适合压缩总结,依赖细节的任务需要保留轨迹,而跨任务训练则必须关注负迁移与泛化稳定性。

从评测角度看,S³Gym 也提示研究者区分“记住成功案例”和“形成可复用政策”。未来的自进化智能体评估,可能需要同时考察探索质量、判断可靠性、留出环境表现以及长期迁移能力。只有当这些环节能够闭环,智能体的自测与自评才可能真正转化为持续改进。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
代码检索不只要“像”:ExecRetrieval揭示嵌入模型的功能正确性缺口
模型评测
cctest.ai
模型评测

代码检索不只要“像”:ExecRetrieval揭示嵌入模型的功能正确性缺口

ExecRetrieval构建了包含近乎相同但实际有错代码的检索基准,专门测试代码嵌入能否把正确实现排在错误变体之前。结果显示,模型在扩大召回范围后表现很好,但首位排序仍存在明显功能性缺口。

阅读全文