返回文章列表
模型评测

语音大模型会先听清再行动吗?VGBench揭示上下文门控难题

阅读约 2 分钟

导语

语音助手最危险的错误,不一定是“听错了”,也可能是“听懂了却不该执行”。在多人交谈、用户自言自语或远处有人发出相同指令时,智能体需要判断这句话是否针对自己,再决定保持沉默、调用工具,还是用自然语言回应。

论文《Do Audio LLMs Listen Before They Act?》提出了VGBench,专门测试音频大模型在这一行动前置判断上的能力。

核心要点

  • 从识别内容转向判断是否应行动。 VGBench包含1018个诊断样本,统一设置“静默、工具调用、自然语言回答”三类动作,避免只用语音识别准确率衡量模型。
  • 覆盖三类容易误触发的场景。 测试包括旁谈、自言自语,以及说话人从设备佩戴者切换到旁观者。后者固定文字内容,只改变声源、距离渲染和时间边界,从而观察模型是否真正利用了声学与对话上下文。
  • 原始模型会识别工具,却不善于收手。 六个未经专门训练的音频大模型和三种免训练适配方法,通常能够找出相关工具,但面对说话人切换时很少选择静默,最高的原始切换静默率仅为14%。
  • 专门训练能明显改善门控。 研究以VoxGate为案例进行监督训练。模型对切换后的指令有91.3%的静默率,同时在近距离佩戴者指令和纯文本控制上都选对了工具。探索性的GRPO训练也保持了相近的切换表现,并将旁谈准确率从68.4%提升到70.9%,自言自语静默率从52.0%提升到60.0%。

这项工作意味着什么

VGBench的价值在于把“是否被寻址”从一个模糊的产品体验问题,转化为可诊断的动作级评测。结果说明,语音智能体的关键短板不只是说话人识别,而是能否综合声源变化、远近声场和对话时序等多个线索作出行动决策。

研究中的因子化控制进一步发现,声源变化本身具有独立影响;但模型对远场处理的敏感度会随声学渲染方式变化。这意味着,单一的说话人标签或固定音频增强策略,可能不足以覆盖真实环境。

对智能音箱、耳机助手和可调用工具的语音代理而言,正确的“保持沉默”与正确回答同样重要。未来评估不应只问模型听到了什么、能调用什么,还要追问:它是否判断出这句话是对谁说的,以及在不确定时能否克制行动。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
PhysVista:用“感知—推理—评估”闭环检验 VLM 的物理智能
模型评测
cctest.ai
模型评测

PhysVista:用“感知—推理—评估”闭环检验 VLM 的物理智能

PhysVista 提出一个面向视觉语言模型的物理智能评测框架,将物理状态感知、动力学推理与物理合理性判断纳入同一认知闭环。基准同时覆盖真实视频与 AI 生成视频,用于检验模型是否真正理解动态世界,而不只是识别画面内容。

阅读全文
CCTest · Blog
OpenTumorBoard:让大模型接受真实肿瘤多学科讨论考验
模型评测
cctest.ai
模型评测

OpenTumorBoard:让大模型接受真实肿瘤多学科讨论考验

OpenTumorBoard从219场公开肿瘤委员会会议中整理出611个病例和近两万轮讨论,为评估模型参与复杂、多专家协作式临床决策提供了新基准。结果显示,即使是前沿通用模型和医疗模型,在复现专家回答与委员会结论方面仍有明显差距。

阅读全文