JoyAI-Echo-1.5:让音视频生成从短片走向持久故事与交互世界
JoyAI-Echo-1.5将长视频生成与交互式世界模型整合到统一的音视频系统中,重点解决角色身份、声音连续性和长期交互稳定性问题。
阅读全文JoyAI-Echo-1.5将长视频生成与交互式世界模型整合到统一的音视频系统中,重点解决角色身份、声音连续性和长期交互稳定性问题。
阅读全文一篇综述重新审视智能眼镜:它们的价值不只在于拍摄和显示,而在于能否把感知、记忆、交互与行动连接成可靠闭环。真正的难点,是在能耗、隐私和安全约束下持续工作。
阅读全文LAION 发布 LAION-BVD,汇集约 8000 万个视频、总时长达 1000 万小时,并覆盖视频、音频与图像三类训练信号。研究显示,基于场景切分和合成描述构建的数据,能够支持多种跨模态任务。
阅读全文DeepSeek 在 API 平台上线 deepseek-v4-flash-vision-exp,首次为 V4 系列明确提供官方视觉输入能力。除了图像理解,新模型在工具调用、代码 Agent 和长周期任务测试中也出现明显提升。
阅读全文DeepSeek 为 V4-Flash 推出实验性视觉版本 DeepSeek-V4-Flash-Vision-Exp,并通过 API 开放调用。官方信息显示,该版本在保留纯文本能力的同时,重点提升了视觉处理能力。
阅读全文DeepSeek Harness 公测一周后发布 v0.1.0-rc.8,新增原生图片请求与图文混合输入,并继续强化子 Agent、Windows 终端和极简模式。更值得关注的是,图片能力开始从单次对话走向命令与任务编排。
阅读全文MOSS-VL 将实时交互作为视觉语言模型的核心能力,通过门控交叉注意力、交互式训练数据与分阶段课程学习,实现边看边说。报告显示,它在多个开放流式评测中取得领先表现,并在视觉上下文变长时展现出更明显的首 token 延迟优势。
阅读全文SPARGen 尝试用一个原生多模态生成模型处理多类空间任务,将三维重建、稠密对应和空间推理都转化为由指令驱动的生成问题。它的价值不在于单点任务刷新纪录,而在于让不同空间监督共同塑造同一套表示。
阅读全文UniSwap 面向说话视频中的身份替换任务,尝试在一个音视频扩散 Transformer 内同时迁移人物外观与声音音色。它的重点不只是生成效果,而是让换脸、换声、口型、动作和时序在流式场景中保持一致。
阅读全文Ex-Omni-2D试图解决一个关键问题:现有能听会说的多模态对话模型,往往缺少“视觉存在感”。它把文本、个性化语音和参考条件下的视频生成整合到同一套对话流程中。
阅读全文Evidence-RL 关注视觉语言模型中的一个核心问题:模型回答问题时,究竟依赖了图像里的关键证据,还是依赖语言先验和数据捷径。论文提出 CED 训练审计机制,用反事实方式检验答案与局部视觉证据之间的因果关系。
阅读全文一项来自真实图像创作产品的数据研究指出,多轮图像编辑中的“下一步建议”必须看懂当前画面,而不能只依赖聊天文本。论文提出三阶段框架,通过人工意图构建、用户点击反馈强化学习和视觉校验器,显著提升了建议的可用性与一致性。
阅读全文Kandinsky Lab 发布 KVAE 系列技术报告,覆盖音频、图像和视频三类 tokenizer,目标是服务于文本条件下的潜在扩散生成。报告称,该系列在重建与生成指标上可匹敌或超过多个前沿开源 tokenizer。
阅读全文这篇工作不只是报告一个新模型,而是系统回答:语言、视觉理解和视觉生成在统一预训练中到底如何互相影响。作者把结论归纳为知识流动、模态协同、早期统一和高效训练配方四个层面。
阅读全文这项工作试图把 3D 理解、文本生成、指令编辑和部件生成放进同一套架构里。核心突破不只是模型设计,还有一套规模化的 3D 多模态数据构建方案。
阅读全文VAD 试图解决多模态 on-policy 蒸馏中的一个关键问题:教师模型给出的纠正到底有多少来自图像证据,而不是语言先验或教师自身偏好。它通过反事实目标重构,让学生主要学习由视觉证据支持的那部分信号。
阅读全文这篇论文聚焦多参考图像编辑中的一致性难题,提出多维度 Evaluation-Verification Reward(EVR),用“先提出判断、再证据验证”的方式为强化学习提供更可靠的奖励信号。
阅读全文微软团队提出 Mage-VL,将视频编解码信息直接引入视觉 token 化过程,试图让多模态模型更适合实时流式感知。其核心看点是用运动向量和残差信息减少无效视觉 token,并在视频理解与空间推理上提升效率。
阅读全文ClinFusion 将医疗多模态大模型的重点重新拉回“看得准”:它试图统一理解 2D 与原生 3D 医学影像,并用更贴近放射科实践的方式评测模型输出。
阅读全文VisCo 提出一种更省训练成本的视觉 Token 压缩思路:不再额外外挂复杂压缩器,而是复用预训练视觉语言模型自身的编码能力。它用少量 memory tokens 承载图像信息,在高压缩率甚至单 Token 场景下保持更稳定表现。
阅读全文腾讯混元团队研究了原生多模态预训练在固定算力下的规模化规律,试图回答模型大小、训练 token 数与数据配比应如何分配。论文指出,语言目标与多模态目标呈现出不同的 scaling 行为。
阅读全文