返回文章列表
多模态

Motion-Omni:让对话模型同时决定“说什么”和“怎么动”

阅读约 3 分钟

导语

让虚拟人真正参与对话,难点不只是把文字变成声音,还要让表情、手势和身体动作与说话内容及节奏同步。现有方案通常采用级联流程:先由语音对话模型生成回复,再把完整音频交给协同动作模型。这种做法容易部署,却需要额外进行一次完整推理,也使“说什么”和“怎么动”难以共同优化。

北京大学团队提出的 Motion-Omni,尝试从模型架构上取消这一割裂。论文发表于 Hugging Face Daily Papers,核心思路是让语言模型、语音生成器和动作生成器共享产生语音的隐藏状态,并同步输出语音、面部表情、手部动作、上半身动作和下半身动作。

核心要点

  • 从级联转向联合生成:动作不再只读取已经生成的音频,而是直接利用产生语音的内部表示,因此有机会更早捕捉语义、韵律和节奏信息。
  • 联合训练是关键:研究发现,如果冻结语音路径,只训练动作部分,动作与音频仍会出现错位。只有同时调整 LLM、Speech Generator 和 Motion Generator,才能在保留对话能力的同时改善同步性。
  • 用伪标签扩大数据规模:团队通过可替换的动作教师模型,为保持一致音色的语音回复生成动作标注,整理出422,856组、总计1,402小时的质量排序样本。这为全身语音对话数据不足提供了一条可扩展路径。
  • 建立统一评测:研究发布 SwDA-500,并提出面向随机、开放式全身语音对话的公开评测流程,覆盖统一渲染、自动指标、人工评价和延迟测量。不同动作系统在相同音频条件下进行比较,减少了音频差异带来的干扰。
  • 速度与质量兼顾:以 Qwen2.5-7B-Instruct 为骨干的 Motion-Omni-Q7,在无参考动作指标上与教师级联系统的差距控制在2%以内;响应速度为实时因子0.78,即快于实时播放。其词错误率为2.62%,在论文比较的全模态系统中最低。

意义与影响

Motion-Omni的价值不只在于把多个输出头放进一个模型,更在于证明语音与动作可以围绕同一组内部表示进行协同学习。相比“先说后动”的工程拼接,联合生成有望减少推理开销,也为语义、韵律、情绪和身体表达之间建立更直接的联系。

不过,论文结果仍主要反映特定数据、动作教师和评测设置下的表现。伪标签质量、动作风格覆盖范围,以及模型在不同角色、语言和交互场景中的稳定性,仍需要更多公开实验验证。SwDA-500和统一评测协议的发布,则为后续研究比较端到端模型、级联系统和不同动作生成方法提供了较清晰的基础。

如果这一方向继续发展,实时虚拟人、游戏角色、数字客服和具身交互系统可能不再把语音和动作视为两个独立模块,而是将其作为一次统一的多模态决策来生成。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章