GigaBrain-0.7:用三系统架构推动具身模型跨机器人泛化
具身智能正在从“看懂指令并执行动作”走向更完整的环境建模与行动规划。GigaBrain-0.7的核心尝试,是用三系统架构重新组织视觉语言行动模型的能力边界:模型不仅要理解用户指令,还要预测环境变化,并在真正执行前对可能的行动进行模拟和评估。
从VLA到三系统协同
传统VLA模型通常将视觉、语言输入直接映射为机器人动作。这种范式在结构化场景和较短任务链中已经表现出实用价值,但当机器人需要面对不同本体、陌生环境或更长的操作流程时,单纯的输入到动作映射可能难以覆盖复杂的决策需求。
GigaBrain-0.7引入的第三个系统被描述为世界模型,负责把环境预测纳入机器人实时决策回路。简单来说,机器人可以先“想一遍”可能发生什么,再选择更合适的动作。素材没有披露该系统的具体模块规模或推理延迟,因此目前更适合将其视为一种架构方向,而不是已经被完整验证的通用规划方案。
数据规模与训练方式
该模型将预训练数据扩展到超过3.7万小时,覆盖更为异构的具身数据。数据规模本身并不自动等同于泛化能力,但对于跨任务、跨机器人本体训练而言,更广泛的数据分布有助于减少模型对单一平台和固定操作模式的依赖。
训练层面,团队提出“一阶段对齐”方法,同时优化视觉语言理解和多本体行动生成。配合双金字塔框架,目标是让单个预训练模型具备“一个模型、多种任务”的基础能力,而不是为每个机器人或任务分别建立独立策略。
评测与现实意义
论文称,GigaBrain-0.7相较此前GigaBrain-0系列及π₀.₅,在基础零样本能力、语言条件指令跟随和后训练任务成功率方面均有明显提升。在自研Maker H01平台以及其他主流机器人本体上,模型覆盖家庭和工业场景;素材还称其在RoboColiseum的四项评测中均排名第一,并完成过一次超过20分钟、包含十余项任务的连续操作演示。不过,现有材料没有提供具体分数、实验设置或失败案例,外部读者仍需等待论文完整实验细节和可复现实验。
意义与待观察问题
GigaBrain-0.7的价值不只在于扩大模型和数据规模,更在于尝试将世界模型置于实时行动环路中。如果这一设计能够在不同机器人之间稳定迁移,具身基础模型或许能从“会执行示范动作”进一步走向“理解目标、预测后果并自主选择动作”。
但跨本体泛化仍受到传感器、动作空间、控制频率和数据质量等因素影响。项目计划公开训练代码和预训练权重,相关资源的实际可用性、复现成本以及在开放环境中的表现,将是判断这项工作的关键。
评论
正在确认登录状态……
正在加载评论……