X-AuT:用渐进式蒸馏压缩语音大模型音频编码器
语音大模型的推理成本,不只取决于语言模型本身,前端音频编码器的深度同样会影响延迟与计算量。针对这一问题,X-AuT尝试压缩语音模型的音频塔,但没有把“删掉几层”视为简单的结构裁剪,而是将其处理为一个需要重新对齐表示和行为的蒸馏过程。
核心方法
传统的整块剪枝会改变送入解码器的音频嵌入。摘要指出,这类扰动可能导致漏字,甚至让模型过早输出结束标记。X-AuT首先使用短时行为探测,评估不同层组合的表现,再选择压缩配置。随后,框架通过多种训练信号修复被裁剪模型:
- 表示对齐:让学生模型的中间或输出表示尽可能接近教师模型;
- 跨尺度蒸馏:在不同层级或尺度上传递教师模型的信息,而不只比较最终结果;
- 学生策略监督:在训练过程中逐步引入学生自身的输出策略,降低训练目标与实际推理之间的偏差;
- LoRA微调:冻结语言模型主干,只更新注意力LoRA适配器和绑定的输出嵌入。
训练数据还经过转录一致性流程筛选,并优先使用一致性最高的样本层级;进入微调阶段后,数据源权重也会进一步调整。这说明该方法不仅压缩网络结构,也试图控制数据质量和训练阶段之间的相互影响。
实验结果
在十个公开中英双语基准上,Qwen3-ASR-0.6B的音频编码器从18层减少到16层后,宏平均错误率由5.61%降至5.27%。进一步压缩到14层时,音频塔参数减少20.7%,平均错误率为5.75%。这两个结果构成了较为明确的工程折中:16层配置在给定实验中取得更低错误率,14层配置则提供更高的参数节省。
消融结果也凸显了训练路径的重要性。在相同配方下,使用1.7B教师模型时,平均错误率为5.55%;自蒸馏结果为8.45%。此外,先从18层逐步压缩到14层的方案,优于直接剪枝到14层,错误率分别为5.75%和6.73%。不过,这些结果来自单次运行,且不同基准的变化并不一致,因此不宜直接视为所有任务上的普遍增益。
意义与局限
X-AuT的价值在于把音频编码器压缩从静态删层,推进到“结构选择、行为探测、表示恢复”协同的流程。对于部署型语音识别系统,这种方法可能帮助开发者在准确率、模型规模和推理成本之间寻找更细的平衡。与此同时,实验规模和单次运行设置也意味着仍需更多重复实验、延迟测量及不同硬件上的验证,才能判断压缩带来的实际端到端收益。
评论
正在确认登录状态……
正在加载评论……