TurboVLA:把机器人视觉语言动作模型压到 1GB 显存内实时运行
导语
机器人领域的视觉-语言-动作模型(VLA)正在快速发展,但一个现实问题始终存在:许多方案把大语言模型放在系统中心,让视觉信息先进入语言模型的表示空间,再由语言模型相关模块解码成动作。这一路径在能力上有吸引力,却会在每一次策略调用时带来显著的计算和显存成本。TurboVLA 的论文正是针对这一瓶颈提出了一个更“短路”的设计:不再让 LLM 充当视觉与动作之间的核心中介,而是让视觉和语言特征直接协同生成动作。
核心要点
- 范式变化:传统 VLA 常被概括为 V→L→A,即视觉先被投射到语言模型空间,再转为动作;TurboVLA 将其改写为 V+L→A,更强调任务指令与视觉观察对动作预测的直接条件化。
- 架构更轻:模型分别编码视觉观察和语言指令,然后通过轻量级的双向视觉-语言交互交换信息,最后由紧凑解码器预测连续动作片段。
- 资源占用较低:论文给出的结果显示,TurboVLA 仅有 0.2B 参数,在消费级 RTX 4090 上推理延迟为 31.2ms,推理显存占用 0.9GB,对应约 32Hz 的实时运行水平。
- 基准表现突出:在 LIBERO 上,TurboVLA 达到 97.7% 平均成功率,论文称其能够匹配或超过一些规模更大的 VLA 策略。
- 代码已开放:项目提供了 GitHub 仓库,有助于研究者复现、比较和进一步扩展这一设计。
意义与影响
TurboVLA 的价值不只是“更小更快”。它提出的问题更根本:在机器人控制任务中,大语言模型是否必须处在体系结构的中心?如果任务目标是根据当前视觉状态和语言指令生成连续动作,那么将视觉与语言信息直接融合,再进入动作解码器,可能比让所有信息绕经大型语言模型更经济。
这对具身智能落地尤其重要。真实机器人通常需要低延迟、高频率和稳定的控制循环,而显存和算力预算往往有限。若一个 VLA 模型能在单张消费级显卡上以低于 1GB 的推理显存运行,并维持较高任务成功率,就降低了实验室和应用场景部署的门槛。
当然,当前素材主要展示的是 LIBERO 上的结果,仍需要更多真实机器人、多任务泛化和复杂长程任务验证。但 TurboVLA 至少给出了一个清晰信号:高效 VLA 不必完全沿着 LLM-centric 路线扩张,面向动作生成的专门化、轻量化结构可能成为机器人模型的重要方向。
评论
正在确认登录状态……
正在加载评论……