Realtime-Venus:让语音与视觉对话进入全双工时代
导语
传统语音助手往往采用“用户说完—系统处理—助手回答”的轮流式交互。当对话需要持续观察画面、处理外部任务,或用户在助手回应时继续说话,这种模式就容易产生延迟和上下文断裂。Realtime-Venus 试图从系统架构层面改变这一点:让模型能够持续感知、主动回应,并在对话不中断的情况下把复杂任务交给后台执行。
两个模型,覆盖两类实时交互
Realtime-Venus 包含两个分别训练的 9B 模型。Realtime-Venus-Omni 面向音频与视频交互,需要同时理解声音、语言以及不断变化的视觉环境;Realtime-Venus-Audio 则聚焦 spoken interaction,负责连续语音输入、理解和原生语音输出。二者都不是单一的识别模块,而是完整的会话前端,整合了持续感知、对话控制与语音生成。
系统的关键设计是“共享因果时间线”。用户输入、模型输出和任务委托事件都被放入同一时间序列中,使模型能够处理实时流式信息,而不是只围绕一轮已经结束的问答进行推理。这为打断、重叠发言和上下文持续更新提供了统一基础。
前台对话与后台任务并行
Realtime-Venus 的运行时采用双循环结构:前台循环负责维持实时互动,后台循环则由 Realtime-Venus-Harness 执行推理、工具调用或其他耗时任务。后台任务运行期间,用户仍可以继续说话或与系统交流;当任务返回结果后,系统再将结果整合进正在进行的对话。
这一机制的价值不只是降低等待感,更在于重新划分了实时助手的职责。即时回应不必被复杂任务完全阻塞,模型也可以在对话持续推进时处理更长链路的工作。不过,素材并未披露 Harness 支持的具体工具类型、部署成本或端到端延迟,因此不宜据此推断其已经适用于所有实际场景。
评测表现与意义
论文称,在参与比较的在线模型中,Realtime-Venus-Omni 在八项视频基准中的六项取得最高分,其中包括 StreamingBench 的 70.2%、OVO-Bench 的 64.7% 和 Daily-Omni 的 81.3%。在八项音频理解与语音问答基准中,Realtime-Venus-Audio 在 MMAU、MMAU-Pro、Llama Questions 和 Speech CMMLU 上领先,分数分别为 78.0%、63.2%、83.8% 和 67.8%。这些结果显示,系统不仅关注低延迟生成,也重视持续多模态理解能力。
更值得关注的是其训练思路:离线理解训练、主动式全双工轨迹,以及任务委托流程被纳入同一套后训练方案。若这一方向能够进一步验证,实时助手可能从“回答问题的接口”转向“持续协作的前端”。但其真实体验仍取决于打断处理、任务失败恢复、工具可靠性和不同设备上的延迟表现,这些也是后续落地需要重点观察的部分。
评论
正在确认登录状态……
正在加载评论……