返回文章列表
多模态

Ex-Omni-2D:让对话模型“看得见”的多模态生成框架

阅读约 2 分钟

导语

多模态对话模型已经能“听懂”图片、音频和文本,也能生成自然语音,但大多数系统的回复仍停留在声音层面,缺少一个能与用户实时互动的“可见形象”。Ex-Omni-2D正是围绕这个缺口展开:它希望让对话不仅能说,还能“出现”。

核心要点

  • 统一输出三种结果:模型在一次对话中同时生成文本、个性化语音和参考条件下的视频。
  • 先规划再生成:给定多模态问题、参考图像和参考音频后,模型先预测一个结构化的 Visual Thought Plan(VTP),描述场景、情绪和动作,再生成回应文本与语音单位。
  • 共享声学-时间接口:这些多码本语音单位既可解码为语音,也能在线与视频帧对齐,使语音路径和头像路径共享一套中间表示。
  • 减少重监督依赖:由于语音、对话和头像视频数据可以分别参与训练,系统不必依赖大规模“问题-文本-语音-视频”四元监督。
  • 教师-学生式流式生成:论文先用完整序列的视频生成器作为教师,再蒸馏出少步数的 block-causal Streaming Student,并通过 Prefix Streaming 机制在连续块之间携带更干净的潜变量,缓解后续片段质量下降。

意义与影响

这项工作的价值,不只是“把视频加到对话里”,而是尝试建立一条更自然的 embodied dialogue 路线:模型输出的不再是抽象回答,而是带有表情、动作和视觉存在感的协调响应。对于虚拟人、交互式客服、陪伴式助手等场景,这种形式更接近真实交流体验。

从工程角度看,Ex-Omni-2D也强调了效率。论文给出四步推理下、四卡完整流水线的端到端实时性表现,说明它并非只追求概念上的统一,而是在质量与速度之间寻找可落地的平衡点。未来如果这类框架继续成熟,多模态助手可能会从“会说话”进一步走向“有形象、能同步表达”的新阶段。

来源: Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
图像对话不该只会等指令:让 AI 主动推荐下一步编辑
多模态
cctest.ai
多模态

图像对话不该只会等指令:让 AI 主动推荐下一步编辑

一项来自真实图像创作产品的数据研究指出,多轮图像编辑中的“下一步建议”必须看懂当前画面,而不能只依赖聊天文本。论文提出三阶段框架,通过人工意图构建、用户点击反馈强化学习和视觉校验器,显著提升了建议的可用性与一致性。

阅读全文