返回文章列表
机器人与物理 AI

NavMCP:让基础模型协作,推动机器人走向长程导航

阅读约 3 分钟

导语

机器人要在真实环境中完成“找到目标并回答问题”这类任务,难点并不只是看懂画面或走到某个地点,而是要在较长时间内持续推理:当前信息是否足够、下一步应该搜索哪里、哪些线索已经被排除,以及什么时候可以停止。论文《Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation》提出 NavMCP,尝试用模型之间的结构化协作解决这一问题。

核心要点

  • 让不同模型各司其职。 视觉语言模型(VLM)擅长理解任务、补全未知信息和调整高层计划,但反复把计划落地为可靠移动时可能不够稳定。导航基础模型(NFM)则能执行语义导航目标,却通常以有边界的单次任务为单位,缺少持续的任务级记忆。NavMCP 将两者组合:VLM 决定“要寻找什么证据、去哪里找、何时结束”,NFM 负责把每个子目标转化为闭环导航行为。

  • 用三个通道连接推理与行动。 “意图”通道把证据需求转换成导航调用;“观测”通道将导航过程和结果返回为有来源的轨迹证据;“记忆”通道保存已经发现的内容、未发现某物的负面证据,以及仍未解决的目标。这样,机器人不必把每次移动视为孤立尝试。

  • 不依赖重新训练。 该方法的重点不是打造一个全新的端到端模型,而是设计一层代理式脚手架,把已有 VLM 与 NFM 组织成可持续交互的系统。这为复用现有基础模型提供了相对直接的路径。

  • 在模拟与实体平台上验证。 在 HM-EQA、MT-HM3D 和 EXPRESS-Bench 等具身问答基准上,NavMCP 达到文中所报告的领先结果。在代理模型和执行器相同的对照设置下,它在 HM-EQA 上较单次情节式接口提升 14.9 个百分点。搭载 Unitree Go2 的测试中,系统成功率达到 78.3%;随着任务跨度变长,相对最强基线的优势由 10 个百分点扩大到 45 个百分点。

意义与影响

NavMCP 的价值在于重新定义了“导航模型如何成为智能体”的问题。单次导航能力并不自动等于长程自主性,真正的瓶颈往往出现在任务分解、信息回收和跨回合记忆上。通过把推理与执行拆开,再用明确的接口连接,系统可以保留 NFM 的运动可靠性,同时利用 VLM 处理开放式目标和不完整信息。

这一思路也提示,未来具身智能的进展未必完全依赖更大模型或端到端训练。更成熟的记忆格式、证据管理和停止策略,可能同样决定机器人能否在复杂环境中少走重复路线、识别已经排除的方向,并把有限的移动预算用于真正有价值的探索。当然,现有结果主要围绕具身问答和特定机器人平台展开,协作框架在更多环境、传感器和任务类型中的稳定性,仍需要进一步验证。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
VLA不只靠堆数据:VLAct把表示学习放在机器人泛化之前
机器人与物理 AI
cctest.ai
机器人与物理 AI

VLA不只靠堆数据:VLAct把表示学习放在机器人泛化之前

机器人数据难以像互联网图文数据那样规模化,VLA模型的瓶颈因此不只是数据量,也在于如何从有限轨迹中学习可迁移的视觉—动作表示。VLAct通过多本体继续预训练,在较低算力与下游数据预算下取得了较强表现。

阅读全文
CCTest · Blog
美国筑起无人机与机器人壁垒,中国的规模优势仍在外部市场延伸
机器人与物理 AI
cctest.ai
机器人与物理 AI

美国筑起无人机与机器人壁垒,中国的规模优势仍在外部市场延伸

美国正通过关税和技术限制减少对中国无人机、先进机器人的依赖,但这未必会形成彻底的中美市场切割。中国制造商的成本、供应链和规模优势,可能推动竞争转向更多区域市场。

阅读全文