RynnBrain 1.1 发布:面向机器人操作的具身基础模型再进化
阅读约 2 分钟
导语
阿里达摩院团队发布的 RynnBrain 1.1,延续了“让大模型真正进入机器人身体”的思路。它不是单纯把视觉语言模型搬到机器人上,而是尝试在训练阶段就把时空关系、物理约束和动作执行纳入统一框架,目标是让模型既能理解环境,又能为操作决策提供更直接的支撑。
核心要点
- 覆盖多种规模:RynnBrain 1.1 提供 2B、9B 和 122B-A10B 三档模型,方便在不同算力与应用场景中部署。
- 统一的具身建模:模型围绕具身感知、空间推理、定位和规划进行训练,强调时空信息与物理世界的结合。
- 更贴近操作任务:相较 RynnBrain 1.0,新版本引入了接触点预测,并为 2B 和 9B 版本加入原生 3D grounding,使输出更适合机器人抓取、接近和交互。
- RynnBrain-VLA 面向多本体:团队还构建了 RynnBrain-VLA,通过统一跨本体动作空间和本体特定 masking,适配 Unitree G1、Astribot-S1 和 Tianji-Wuji 等平台。
- 评测与实机验证:论文称,122B-A10B 在 VSI-Bench、MMSI 和 RefSpatial-Bench 上超过了评测中的开源与闭源模型;在真实机器人实验中,RynnBrain 初始化的策略也优于基于 Qwen 的方案和代表性的通用 VLA。
这意味着什么
这项工作的重要性在于,它把“具身智能”从单纯的多模态理解,推进到更强的物理对齐与动作可迁移能力。对于机器人来说,真正有价值的并不是文本回答是否流畅,而是模型是否知道该看哪里、碰哪里、如何规划动作路径,以及在不同机器人上是否还能保持稳定泛化。
从技术路线看,RynnBrain 1.1 的思路有两个值得注意的方向。第一,是把 3D grounding、接触点预测等任务前置到模型能力中,减少感知结果与执行动作之间的断层。第二,是通过多任务、多本体联合训练提升泛化,而不是为每个任务或平台单独训练一套策略。
不过,这类模型距离大规模落地仍有现实门槛:复杂环境中的鲁棒性、长时序任务的稳定性、以及不同机器人硬件之间的适配成本,都会影响最终效果。即便如此,RynnBrain 1.1 仍然说明,具身基础模型正在从“能看懂”走向“能操作”,而这正是机器人智能化真正需要跨过的一步。
评论
正在确认登录状态……
正在加载评论……