RoboFoundry:让机器人把执行经验沉淀为可进化系统
导语
让机器人完成一次任务,并不等于它真正学会了如何完成这类任务。现有具身智能系统通常把记忆、上下文管理、技能库和动作接口拆开优化,基础模型负责决策,外围模块负责提供信息或执行动作。但如果失败经验不能转化为稳定、可验证的系统变化,机器人的下一次尝试仍可能从原点开始。
RoboFoundry试图改变这一范式。论文将其定义为“自演化的系统即策略”(Self-Evolving System-as-Policy):策略不再只存在于模型参数或单次提示中,也体现在支撑智能体运行的上下文、记忆、技能组织方式和恢复机制里。
核心要点
- 从执行轨迹中诊断缺口。 RoboFoundry分析任务执行过程,定位决策、记忆管理等环节的问题,再把经验转化为面向特定任务的系统更新,而不是简单保存原始日志。
- 两类系统表面协同演化。 上下文系统负责管理当前活跃信息与文件系统中的持久记忆;分层技能系统则组织原子技能、可复用组合技能,以及针对失败情况设计的恢复流程。
- 更新需要验证和推广。 新形成的能力先针对具体任务进行验证,反复出现且可靠的改进才会被提升到通用系统中。这种机制试图减少错误经验被长期保留的风险。
- 决策与执行解耦。 共享语义接口把与具体机器人无关的任务决策,同不同机器人各自的动作执行分开,从而支持系统能力在异构平台之间迁移。
实验表现
在EmbodiedBench上,RoboFoundry取得论文所称的当前最佳表现,并使GPT-5.5的成绩提升27.8%。在同一设置下,Qwen3.7-Plus达到70.3%,接近GPT-5.5的72.7%,说明收益并不局限于某一个基础模型。针对长时程记忆的RoboMemArena,RoboFoundry相比所有基线至少高39.0%,其中也包括借助外部基础模型的方法。在LIBERO-PRO的不同扰动类型上,它相较Cap-Agent0的提升幅度为243.8%至679.7%。论文还报告了真实机器人上的零样本迁移和在线演化案例。
意义与局限
RoboFoundry的重要性在于,它把“智能体如何改进自己”从模型训练问题扩展成系统工程问题:失败不仅提供反馈,也可能改变记忆结构、技能层级和未来的恢复路径。对于长周期、步骤多且环境变化明显的机器人任务,这种持续积累尤其关键。
不过,论文摘要并未给出完整的更新算法、验证成本、失败更新的具体比例,以及不同硬件平台上的详细对比。因此,系统能否在更开放、更高风险的现实环境中稳定演化,仍需要更多公开实验验证。总体而言,RoboFoundry展示了一条清晰路线:具身智能的进步,可能不只来自更强的基础模型,也来自一个能够筛选、验证并继承经验的外部系统。
评论
正在确认登录状态……
正在加载评论……