返回文章列表
多模态

Vivix发布实时互动多模态模型A1:让虚拟角色“边听边动”

阅读约 2 分钟

导语

Vivix灵动时刻发布了实时交互多模态模型A1,并同步提到面向可介入剧情世界的W1。相比常见数字人或短片式视频生成,A1强调的是“视频通话式”的连续互动:屏幕中的角色不仅能说话,还能根据用户的声音、指令和环境变化实时改变动作、姿态与后续画面。

核心要点

  • 统一流式架构:A1把图片、视频、声音、历史帧、交互记录等共同纳入持续状态,让角色身份、场景和物体关系在不断生成中保持一致。
  • 多模态交互不止文本:模型不把ASR文本作为唯一中间层,而是直接利用语义、声学特征、环境声、手势和动态视觉信号。用户语气变化或环境事件,都可能影响尚未生成的内容。
  • 快慢两层响应:素材中提到,A1在约300毫秒时间片内生成最新响应token,偏向即时反应;更上层的Director Agent负责推理、工具使用和长时序行为控制。
  • MJD压缩采样步骤:Vivix提出Multidimensional Joint Distillation,将8-Step质量基线压缩到2-Step推理,同时试图保留短时画质、动作幅度和长时一致性。
  • 推理基础设施VMI:Vivix将Encoder与Decoder解耦,引入prefill/decode分离、KV Cache传输优化、NVFP4训推协同,以及计算、通信、显存联合调度。官方称单卡吞吐超过10000 video tokens/s,新输入最短响应约300毫秒,可见反应平均延迟低于0.6秒。

意义与影响

A1代表的方向,是把数字人从“会对口型的头像”推进到“拥有身体的实时角色”。这意味着模型需要同时处理长期一致性、动作生成、语音与事件理解,以及低延迟推理,难度远高于一次性生成几秒视频。

如果这些能力在真实产品中稳定成立,应用场景会扩展到互动娱乐、陪伴式AI、虚拟客服、游戏NPC和实时内容创作。更重要的是,它把视频生成的竞争焦点从单帧画质转向持续交互体验:角色能否被打断、能否转身行动、能否长期不漂移,将成为新的衡量标准。

不过,素材信息主要来自公司技术博客与媒体报道,实际效果仍需更多公开体验、第三方评测和长时间使用验证。实时多模态生成已经迈出关键一步,但距离真正可靠、可规模化的“平行世界”仍有距离。

来源:量子位

评论

正在确认登录状态……

正在加载评论……

相关文章