返回文章列表
机器人与物理 AI

JoyNexus:面向 VLA 模型的多租户后训练服务框架

阅读约 2 分钟

导语

随着 VLA(Vision-Language-Action,视觉-语言-动作)模型进入机器人与具身智能场景,模型训练不再只是一次性预训练的问题。不同仿真器、机器人本体、任务目标和动作空间,都会迫使开发者在基础模型之上进行持续的监督微调、强化学习和评测。JoyNexus 关注的正是这个“后训练”环节:如何把复杂且高成本的 VLA 后训练,做成可共享、可调度、可隔离的服务。

核心要点

  • 从独占资源转向多租户服务:传统 GPU 租赁或批处理作业往往把一组 GPU/CPU 资源分配给单个用户。灵活性高,但短任务、突发任务会造成费用和资源浪费。JoyNexus 则允许多个租户并发提交训练、rollout 与评测任务。
  • 三类服务解耦:框架将 Training Model Service、Inference Model Service 与 Environment Service 拆分,租户通过 API 调用训练、推理和环境交互能力。这种设计降低了用户适配底层基础设施的负担。
  • 共享基础模型,隔离租户状态:系统背后保留常驻共享 base model,同时为不同租户维护独立的 action modules、optimizers、rollout records 和 policy versions,兼顾复用与隔离。
  • 全局队列调度:JoyNexus 通过 Training Queue 与 Inference Queue 统一调度多租户负载,使服务提供方有机会在不同任务之间填补空闲资源。
  • 面向 VLA 数据的 group batching:对于数据 schema 不同但模型输入前缀兼容的样本,JoyNexus 可将其分组,让共享 backbone 执行一次前向计算,从而减少重复开销。

意义与影响

这项工作的价值不在于提出新的机器人策略模型,而在于把 VLA 后训练视为一种“云服务化”的基础设施问题。对开发者而言,高层语义 API 可降低上手门槛;对需要自定义算法的团队,低层 API 和专属 endpoint 又保留了一定灵活性。对服务提供方而言,多租户调度和 group batching 则有助于提升 GPU 利用率,尤其适合短时、间歇、实验性较强的机器人训练工作流。

当然,素材披露的实验主要强调相较单租户隔离执行的 GPU 利用率提升,并未给出可泛化到所有机器人任务的结论。真正落地时,还需要关注租户隔离的工程安全性、环境服务的可扩展性,以及不同 VLA 架构之间的兼容边界。但 JoyNexus 提供了一个清晰信号:具身智能的竞争不仅在模型本身,也在后训练基础设施的效率与可用性。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
让机器人“按自己的坐标系看世界”:Robot-Centric Pointmaps 改进 VLA 泛化
机器人与物理 AI
cctest.ai
机器人与物理 AI

让机器人“按自己的坐标系看世界”:Robot-Centric Pointmaps 改进 VLA 泛化

KAIST AI 提出的 Robot-Centric Pointmaps 试图解决 VLA 模型中相机视角与机器人动作坐标系不一致的问题。它把场景点的三维坐标直接编码到机器人坐标系下,同时保留类似图像的二维网格结构,便于接入现有 VLA。

阅读全文
CCTest · Blog
小米发布 Xiaomi-Robotics-1:用 10 万小时真实轨迹扩展机器人 VLA 模型
机器人与物理 AI
cctest.ai
机器人与物理 AI

小米发布 Xiaomi-Robotics-1:用 10 万小时真实轨迹扩展机器人 VLA 模型

Xiaomi-Robotics-1 试图把大模型的“规模化法则”引入机器人学习:用超过 10 万小时真实操作轨迹预训练,再对齐真实机器人和自然语言指令。实验显示,更大的数据和模型规模能带来更低动作预测误差,并提升真实机器人任务成功率。

阅读全文