ReactHuman:让多模态模型在危险发生时做出正确反应
导语
看到盘子从桌边滑落,机器人应该伸手接住,还是先后退避让?面对掉落的刀具,模型不仅要识别“发生了什么”,还必须在极短时间内判断是否能够干预、从哪里拦截,以及怎样避免让局面变得更危险。ReactHuman 关注的正是这类从物理理解到即时行动的能力。
从“看懂”到“做对”
过去的物理常识评测,常见形式是让模型观看视频后回答问题;机器人基准则更多考察导航、抓取或整理等较长时间尺度的任务。ReactHuman 试图补上中间的一环:让多模态大模型充当模拟人形机器人的决策大脑,面对突发的家庭危险,并提交可执行的反应计划。
该基准覆盖17类事件、超过1000个场景。场景由240 Hz刚体物理仿真生成,地面真值来自明确的模拟状态,因此不依赖人工逐帧标注,也能够实现逐比特复现。测试还加入了外观与物理属性相冲突的物体,例如泡沫制砧座和钢制苹果,用来检验模型是否会被常识化外观误导。
评测不止看答案
ReactHuman 设计了五项指标,从三个维度考察反应:
- 合理性:行动是否符合当前情境与目标;
- 安全性:行动是否减少人员或环境受到伤害的风险;
- 物理依据:决策是否真正利用了物体运动、材质和碰撞结果等信息。
更关键的是,模型提交的每个计划都会在模拟环境中实际执行。这样,评测对象不再是看起来正确的文字,而是会产生后果的行动。一个“去接住物体”的判断,即使方向正确,若拦截位置偏差达到米级,最终仍可能失败。
实验暴露的短板
研究者使用该框架评估了七种代表性多模态大模型。结果显示,模型大约每三个危险场景就会处理错一个。它们往往依赖固定的行动倾向,而不是根据眼前场景动态调整;面对外观与运动规律不一致的物体时,也容易相信外观而非真实运动状态。即便选择了正确的干预方式,模型仍可能错过合适的拦截点。
这些问题并没有随着模型规模增大而明显消失,说明反应式安全能力并不是一般视觉语言能力自然增长后的附带结果。模型需要更细致地建立运动、时间、距离和动作后果之间的联系。
意义与影响
ReactHuman 的价值在于把具身智能中的“反应速度”和“决策后果”明确纳入评测。对于家庭机器人而言,危险处理不能只依赖语言上合理的解释,而需要稳定、可执行并且物理上可靠的动作。对于模型训练而言,这套基准也提供了更细粒度的失败信号,可用于推动安全感知、运动预测和动作选择的联合优化。
当然,模拟环境仍不能完全替代真实家庭中的传感器噪声、执行延迟和复杂接触。但作为可复现的诊断工具,ReactHuman 提醒我们:让模型理解物理规律,与让模型在关键瞬间做出正确反应,是两项尚未被打通的能力。
评论
正在确认登录状态……
正在加载评论……