返回文章列表
机器人与物理 AI

RoboDawn:让视觉语言模型直接学会控制机器人

阅读约 3 分钟

导语

视觉语言模型已经能够理解图像、文字和复杂任务描述,但让它们真正控制机器人,仍然面临从数字世界到物理世界的多重鸿沟:模型需要理解空间关系、适应动作反馈,还要处理机械臂执行误差。论文《Transferring the Intelligence of VLMs to Robotic Control》提出 RoboDawn,尝试用更直观的控制接口,把通用 VLM 的推理能力转化为机器人动作。

核心方法:把控制变成可理解的“指令语言”

RoboDawn没有让 VLM 直接预测连续的关节轨迹,而是提供一组紧凑的离散动作,包括平移、旋转和夹爪控制。机器人每执行一步,模型都会重新观察当前视觉状态,判断下一步动作,并根据执行结果调整后续计划。这种“观察—推理—执行—再观察”的闭环,使模型能够在动作出现偏差时继续修正,而不是依赖一次性生成完整轨迹。

论文还引入了面向机器人的上下文学习机制。少量示范不仅帮助模型理解接口中各类动作的含义,也提供了完成任务的策略参考。换言之,示范的作用并非单纯告诉模型“按什么按钮”,还帮助它建立从视觉场景到动作序列的对应关系。

实验结果

在 RoboTwin 2.0 C2R 中,RoboDawn 的零样本成功率为 53.2%,加入一次上下文示范后提升至 73.6%,高于基线 π0.5 的 46.0%。在更具挑战性的 RoboDojo 上,成功率也从零样本的 35.67% 提升到一次示范后的 47.17%。这些结果尤其值得注意,因为方法不依赖针对特定任务训练的机器人策略。

研究还报告了三个现象:

  • RoboDawn 在长时程操作任务上取得了超过 47% 的 RoboDojo 成功率,为此类任务提供了较强基线。
  • 上下文学习可以直接在推理阶段改善机器人行为,说明示范和交互历史对具身智能体同样有效。
  • 当放宽推理或交互步数限制时,性能仍会提升,显示出一定的测试时扩展特征。

此外,该框架还被迁移到真实 Franka 机器人上,用于“方块入篮”和方块堆叠任务,表明离散接口并不只适用于仿真环境。

意义与局限

RoboDawn的价值在于,它没有把通用 VLM 与机器人控制割裂开,而是通过一个更容易被模型理解的动作抽象层,降低了视觉推理和物理执行之间的接口成本。若这一方向持续发展,机器人可能更多依赖通用模型的知识、规划和上下文适应能力,而不是为每个任务单独收集大量机器人数据。

不过,现有结果主要建立在特定基准和有限真实任务上。离散动作接口能否覆盖更精细、更高速或安全要求更高的操作,模型在遮挡、接触不确定性和长时间累积误差下是否稳定,仍需要进一步验证。总体而言,这项工作展示了一条清晰路径:先让 VLM 学会理解一个简洁可靠的控制语言,再通过闭环交互把数字智能逐步落到物理世界。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Grounded Action Model:让机器人先理解物体位置,再决定如何行动
机器人与物理 AI
cctest.ai
机器人与物理 AI

Grounded Action Model:让机器人先理解物体位置,再决定如何行动

Grounded Action Model(GAM)将3D目标定位直接纳入机器人基础模型,使机器人能够根据语言、点或框提示锁定目标,并结合精确几何信息生成动作。实验显示,这种以对象为中心的设计在场景变化、目标移动和长程操作中具备更强的泛化能力。

阅读全文
CCTest · Blog
让3D扩散策略具备“趋势感”:无需显式轨迹也能预判操作方向
机器人与物理 AI
cctest.ai
机器人与物理 AI

让3D扩散策略具备“趋势感”:无需显式轨迹也能预判操作方向

一项新研究为3D扩散策略加入了轻量级的运动趋势表示,使机器人不仅依据当前观测生成动作,还能判断交互接下来可能如何发展。该方法无需显式规划轨迹,却在多个仿真和真实机器人基准上明显优于DP3。

阅读全文