让机器人像程序员一样工作:Physical Coding 如何推动具身智能自进化
导语
让机器人完成“拿起物体并放到指定位置”并不难,真正困难的是:物体换了位置、视角发生变化、动作中途失败后,机器人能否理解当前状态并调整方案。现有视觉-语言-动作(VLA)和世界-动作(WAM)模型通常直接把观察与指令映射成动作。这样的端到端路径简洁,却也容易把任务条件、执行进度和失败恢复隐含在动作序列中,因而对训练分布高度敏感。
Hugging Face Daily Papers 收录的这项工作提出了“Physical Coding”(物理编码),试图把数字世界中编码代理的工作方式迁移到机器人系统:先明确状态,再调用工具执行,随后根据外部反馈验证并修改计划。
核心思路
- Code as World:把世界写清楚。 系统用代码或结构化表示记录物体、空间关系、约束条件和当前进度。机器人不再只依赖一串难以解释的动作,而是拥有更明确的任务状态。
- Code as Policy:把策略拆开。 规划、动作执行、结果验证和失败恢复被组织为可检查、可修改的程序流程。VLA 或 WAM 仍可作为控制工具,但不再独自承担全部决策。
- Harness 连接模型与现实。 HexaAnything 通过 Harness 调用感知、规划、控制及外部评估工具,并在执行过程中根据反馈做出循环决策。验证成功的轨迹可以沉淀为训练数据、程序或记忆。
- 从执行走向自我改进。 论文观察到工具、数据和模型层面的改进可能形成闭环;更长期的目标还包括自动调整模型架构、表示方式、任务设计,甚至硬件。
实验结果与边界
在 RoboCasa365 上,HexaAnything 将 Composite-Unseen 成功率从 XR-1 VLA 的 34.3% 提升到 38.3%,总体成功率从 56.6% 提升到 60.8%。使用 Harness 收集的数据训练的 27B HexaModel,在每个报告的数据划分上都超过其基础模型。研究还覆盖了工具修改、模拟科学实验和真实机器人执行;在 PhyBench 与双臂 AgileX 机器人上,系统能够自主完成物理实验以及大部分桌面任务,并在部分比较中表现出更快的执行速度。
不过,这些结果更适合被视为架构可行性的初步证据,而不是“机器人已经学会自我设计”。论文明确指出,更广泛的协同进化仍是未来工作。当前方法也依赖 Harness、外部评估器和一组可用工具,真实环境中的感知误差、工具可靠性和长时间运行成本仍可能限制效果。
意义与影响
Physical Coding 的关键变化,不只是给机器人增加一个代码接口,而是改变了具身智能的中间表示:机器人经验可以被保存、检查、复用和重新训练。若这一方向继续成熟,未来的机器人系统可能不再是固定策略的执行器,而更像能够读懂状态、调用技能、验证结果并积累程序经验的代理。对于制造、家庭服务和科学实验而言,这种可修订的执行机制或许比单纯扩大动作数据更有助于应对长时程、开放环境任务。
评论
正在确认登录状态……
正在加载评论……