Duplex-MPE:全双工语音助手不只要会说,还要知道何时闭嘴
导语
在多人交谈的房间里,语音助手面对的难题并不是“能不能听懂”,而是“这句话是不是对我说的”。如果有人正在讨论一个问题,助手贸然插话会打断交流;如果所有人都等着它回答,助手沉默又会让交互失效。对于能够同时听和说的全双工语音模型而言,判断参与时机已经成为比单纯生成语音更关键的能力。
北京大学团队提出的 Duplex-MPE,正是针对这一问题设计的评测基准。它把语音助手放入多人共享对话,而不是传统的单用户问答场景,考察模型能否在真实感更强的连续语音中做出选择性参与。
核心要点
- 面向多人共享对话。 基准包含2000个场景,每个场景有三或四名人类说话者和一名助手,并围绕同一个请求设置“明确指向助手”和“隐含表达”两种配对情况。
- 输入更接近实际使用。 模型接收连续对话音频,没有转写文本,也没有提前提供说话轮次。因此,它必须自行判断谁在说话、请求是否针对自己,以及当前是否适合介入。
- 四种能力分开计分。 评测分别关注新回应的启动、回答是否正确、在不该发言时能否保持安静,以及人类已经解决请求后能否停止说话。
- 频繁发言不是优势。 研究评估了MiniCPM-o 4.5、Moshi、FLM-Audio、Voila和Freeze-Omni五个开放权重语音系统。MiniCPM-o 4.5在四项能力中的三项取得领先;其他系统则可能表现为更经常开口,但回答并不准确,或难以维持沉默。
- 对照模型暴露出明显差异。 一个基于转写文本的Gemini 3.1 Pro参考系统,对明确请求的回应率比隐含请求高64.3个百分点。相比之下,论文称参与测试的语音系统在配对检验中没有发现显著的回应率差异。
为什么重要
现有语音交互评测通常围绕指定用户展开,重点是轮流说话、处理中断或完成多轮对话。这些能力当然重要,但多人场景增加了一个常被忽视的前置判断:助手是否拥有当前发言权。Duplex-MPE将“开口”与“不开口”放在同等重要的位置,也把“及时停下”纳入评测,因而更贴近会议、家庭讨论、车载空间和公共环境中的真实使用需求。
这项工作还提示,模型的活跃程度不能简单当作交互质量的代理指标。一个不断抢话的系统,可能在表面上显得反应迅速,却会制造干扰;一个过于谨慎的系统则可能错过真正需要帮助的请求。未来的全双工助手需要同时优化语音理解、说话人和指代判断、回应决策,以及生成过程中的实时终止控制。
从研究方法看,显式与隐式请求的配对设计,为衡量模型是否真正理解“被谁呼叫”提供了更清晰的参照。Duplex-MPE目前主要揭示了模型在选择性参与上的差距,数据与代码仍在准备发布。随着这类音频基准进一步开放,语音模型的竞争标准或许会从“说得像人”转向“像一个有分寸的对话参与者”。
评论
正在确认登录状态……
正在加载评论……