华为大模型团队创业押注“物理基模”:具身智能需要Scaling Law吗?
导语
语言模型通过海量文本预训练,逐渐形成了跨任务的通用能力;机器人却往往仍要围绕具体本体、环境和任务单独采集数据。前华为云大模型CTO李寅与前华为多模态首席科学家张含望共同创办的息壤开物,正试图改变这一现状:公司把目标指向一种面向物理世界的基础模型,并将其称为LPM(Large Physics Model)。
核心要点
- 融资与团队:息壤开物披露已连续完成数亿元种子轮及天使轮融资,估值约5亿美元。投资方包括敦鸿资产、华控基金、三花控股等。公司团队覆盖模型、数据和系统基础设施三条线。
- LPM要解决什么问题:模型不仅要识别画面,还要理解物体如何运动、动作如何改变环境,以及不同结果背后的因果关系。其目标是让能力在更换机器人本体、材质、光照或任务后仍能迁移。
- 数据与架构:公司计划使用互联网物理视频、第一视角数据、示教数据、仿真数据、公开机器人轨迹和真实反馈。技术路线以统一的自回归Transformer为骨干,扩散模块则用于连续未来状态或视频的生成。
- 能力分层:规划中的L0是跨场景、跨任务、跨本体的通用物理基础模型,L1面向行业领域,L2则服务具体机器人应用。
为什么要做“物理基模”
具身智能的难点不只是看懂场景,而是要在连续变化的环境中持续决策。以收拾桌面为例,机器人需要识别物品、安排顺序、规划路径,并根据每次动作后的变化及时调整。决策步数增加后,可能的行动组合会迅速膨胀,单纯依赖针对任务的示范数据,很难覆盖所有情况。
息壤的思路是把世界状态、动作和下一状态放进同一个连续预测框架。模型先根据当前状态选择动作,再依据反馈更新对未来的判断,而不是预先穷举全部路径。统一Token、强化学习、数据管线和评测体系,则被视为这套闭环的配套基础。
意义与不确定性
这一路线的价值,在于尝试把机器人项目从“一次一训”推向能力复用。如果物理智能确实存在类似语言模型的规模效应,那么更多数据、更大模型和更强算力或许能带来稳定的泛化提升。公司称,其模型在World Arena 2.0相关赛道的轨迹准确性排名第一、物理一致性排名第二,并观察到扩大数据和训练规模后的初步性能提升;这些信息目前主要来自公司披露,仍需要独立评测和真实场景验证。
真正的挑战也很明确:视频中的相关性不等于可执行的因果知识,仿真表现也不必然能迁移到现实。数据质量、长程任务、训练成本、机器人安全性和跨本体泛化,都会决定LPM能否从概念走向产品。息壤计划推出的XIRRA v0.1,或将成为观察这条路线能否继续向前的重要节点。
来源:量子位
评论
正在确认登录状态……
正在加载评论……