返回文章列表
机器人与物理 AI

GigaBrain-0.7:用三系统架构推动具身模型跨机器人泛化

阅读约 3 分钟

具身智能正在从“看懂指令并执行动作”走向更完整的环境建模与行动规划。GigaBrain-0.7的核心尝试,是用三系统架构重新组织视觉语言行动模型的能力边界:模型不仅要理解用户指令,还要预测环境变化,并在真正执行前对可能的行动进行模拟和评估。

从VLA到三系统协同

传统VLA模型通常将视觉、语言输入直接映射为机器人动作。这种范式在结构化场景和较短任务链中已经表现出实用价值,但当机器人需要面对不同本体、陌生环境或更长的操作流程时,单纯的输入到动作映射可能难以覆盖复杂的决策需求。

GigaBrain-0.7引入的第三个系统被描述为世界模型,负责把环境预测纳入机器人实时决策回路。简单来说,机器人可以先“想一遍”可能发生什么,再选择更合适的动作。素材没有披露该系统的具体模块规模或推理延迟,因此目前更适合将其视为一种架构方向,而不是已经被完整验证的通用规划方案。

数据规模与训练方式

该模型将预训练数据扩展到超过3.7万小时,覆盖更为异构的具身数据。数据规模本身并不自动等同于泛化能力,但对于跨任务、跨机器人本体训练而言,更广泛的数据分布有助于减少模型对单一平台和固定操作模式的依赖。

训练层面,团队提出“一阶段对齐”方法,同时优化视觉语言理解和多本体行动生成。配合双金字塔框架,目标是让单个预训练模型具备“一个模型、多种任务”的基础能力,而不是为每个机器人或任务分别建立独立策略。

评测与现实意义

论文称,GigaBrain-0.7相较此前GigaBrain-0系列及π₀.₅,在基础零样本能力、语言条件指令跟随和后训练任务成功率方面均有明显提升。在自研Maker H01平台以及其他主流机器人本体上,模型覆盖家庭和工业场景;素材还称其在RoboColiseum的四项评测中均排名第一,并完成过一次超过20分钟、包含十余项任务的连续操作演示。不过,现有材料没有提供具体分数、实验设置或失败案例,外部读者仍需等待论文完整实验细节和可复现实验。

意义与待观察问题

GigaBrain-0.7的价值不只在于扩大模型和数据规模,更在于尝试将世界模型置于实时行动环路中。如果这一设计能够在不同机器人之间稳定迁移,具身基础模型或许能从“会执行示范动作”进一步走向“理解目标、预测后果并自主选择动作”。

但跨本体泛化仍受到传感器、动作空间、控制频率和数据质量等因素影响。项目计划公开训练代码和预训练权重,相关资源的实际可用性、复现成本以及在开放环境中的表现,将是判断这项工作的关键。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
StreamPI:让单帧视觉语言动作模型具备持续时序理解
机器人与物理 AI
cctest.ai
机器人与物理 AI

StreamPI:让单帧视觉语言动作模型具备持续时序理解

StreamPI在不增加模型参数的前提下,为以单帧输入为主的视觉语言动作模型引入流式时序建模。通过指令锚定注意力与随机间隔训练,它试图让机器人更好地利用历史观察,并适应真实部署中的异步视觉输入。

阅读全文
CCTest · Blog
PhysCaP:让机器人通过主动探索理解物体的隐藏物理属性
机器人与物理 AI
cctest.ai
机器人与物理 AI

PhysCaP:让机器人通过主动探索理解物体的隐藏物理属性

PhysCaP 为代码即策略机器人引入物理信息驱动的主动感知机制,使机器人不再只依赖视觉观察,而是通过有针对性的交互判断物体的质量与刚度。该方法在减少无效探索的同时,提升了复杂桌面操作任务中的决策能力。

阅读全文