返回文章列表
机器人与物理 AI

让机器人像程序员一样工作:Physical Coding 如何推动具身智能自进化

阅读约 3 分钟

导语

让机器人完成“拿起物体并放到指定位置”并不难,真正困难的是:物体换了位置、视角发生变化、动作中途失败后,机器人能否理解当前状态并调整方案。现有视觉-语言-动作(VLA)和世界-动作(WAM)模型通常直接把观察与指令映射成动作。这样的端到端路径简洁,却也容易把任务条件、执行进度和失败恢复隐含在动作序列中,因而对训练分布高度敏感。

Hugging Face Daily Papers 收录的这项工作提出了“Physical Coding”(物理编码),试图把数字世界中编码代理的工作方式迁移到机器人系统:先明确状态,再调用工具执行,随后根据外部反馈验证并修改计划。

核心思路

  • Code as World:把世界写清楚。 系统用代码或结构化表示记录物体、空间关系、约束条件和当前进度。机器人不再只依赖一串难以解释的动作,而是拥有更明确的任务状态。
  • Code as Policy:把策略拆开。 规划、动作执行、结果验证和失败恢复被组织为可检查、可修改的程序流程。VLA 或 WAM 仍可作为控制工具,但不再独自承担全部决策。
  • Harness 连接模型与现实。 HexaAnything 通过 Harness 调用感知、规划、控制及外部评估工具,并在执行过程中根据反馈做出循环决策。验证成功的轨迹可以沉淀为训练数据、程序或记忆。
  • 从执行走向自我改进。 论文观察到工具、数据和模型层面的改进可能形成闭环;更长期的目标还包括自动调整模型架构、表示方式、任务设计,甚至硬件。

实验结果与边界

在 RoboCasa365 上,HexaAnything 将 Composite-Unseen 成功率从 XR-1 VLA 的 34.3% 提升到 38.3%,总体成功率从 56.6% 提升到 60.8%。使用 Harness 收集的数据训练的 27B HexaModel,在每个报告的数据划分上都超过其基础模型。研究还覆盖了工具修改、模拟科学实验和真实机器人执行;在 PhyBench 与双臂 AgileX 机器人上,系统能够自主完成物理实验以及大部分桌面任务,并在部分比较中表现出更快的执行速度。

不过,这些结果更适合被视为架构可行性的初步证据,而不是“机器人已经学会自我设计”。论文明确指出,更广泛的协同进化仍是未来工作。当前方法也依赖 Harness、外部评估器和一组可用工具,真实环境中的感知误差、工具可靠性和长时间运行成本仍可能限制效果。

意义与影响

Physical Coding 的关键变化,不只是给机器人增加一个代码接口,而是改变了具身智能的中间表示:机器人经验可以被保存、检查、复用和重新训练。若这一方向继续成熟,未来的机器人系统可能不再是固定策略的执行器,而更像能够读懂状态、调用技能、验证结果并积累程序经验的代理。对于制造、家庭服务和科学实验而言,这种可修订的执行机制或许比单纯扩大动作数据更有助于应对长时程、开放环境任务。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
RoboFoundry:让机器人把执行经验沉淀为可进化系统
机器人与物理 AI
cctest.ai
机器人与物理 AI

RoboFoundry:让机器人把执行经验沉淀为可进化系统

RoboFoundry提出“系统即策略”的具身智能演化框架,不只优化模型或单项工具,而是让上下文、记忆、技能与执行接口共同形成可持续改进的系统。实验显示,该方法在多个具身任务与长期记忆基准上取得显著提升。

阅读全文
CCTest · Blog
EmbodiedMemory-Bench:用长期交互检验具身智能的记忆能力
机器人与物理 AI
cctest.ai
机器人与物理 AI

EmbodiedMemory-Bench:用长期交互检验具身智能的记忆能力

EmbodiedMemory-Bench 将具身记忆从抽象能力变成可执行的长期交互评测,覆盖视觉细节、动态状态、交互结果和经验迁移四类挑战。研究同时提出结构化外部记忆系统 Embodied-Memorizer,以及能够管理和调用记忆的 EMem-8B 策略模型。

阅读全文
CCTest · Blog
让机器人手学会“像人一样”操作:Morphometric Imitation打通从动作迁移到零样本部署
机器人与物理 AI
cctest.ai
机器人与物理 AI

让机器人手学会“像人一样”操作:Morphometric Imitation打通从动作迁移到零样本部署

加州大学伯克利分校团队提出三阶段 Morphometric Imitation 框架,将重建的人手—物体交互转换为机器人可执行的视觉运动策略。在三种机器人手和十类交互任务的实验中,系统实现了较高的真实世界零样本成功率。

阅读全文