Vivix发布实时互动多模态模型A1:让虚拟角色“边听边动”
Vivix推出实时交互多模态模型A1及世界互动模型W1,主打统一流式生成、低延迟响应和消费级GPU实时推理。其技术重点不只是让角色说话,而是让角色在持续视频生成中保持身份、动作和环境关系的一致性。
阅读全文Vivix推出实时交互多模态模型A1及世界互动模型W1,主打统一流式生成、低延迟响应和消费级GPU实时推理。其技术重点不只是让角色说话,而是让角色在持续视频生成中保持身份、动作和环境关系的一致性。
阅读全文德国 AI 初创公司 Black Forest Labs 发布多模态基础模型 Flux3,主打对图像、视频、音频与动作信息的统一建模。其看点在于引入 Self-Flow 架构,并强调可生成最长 20 秒的音视频同步片段。
阅读全文PaddleOCR 团队提出 HPD-Parsing,用分层并行解码替代整页自回归生成,缓解 VLM 文档解析中的长序列瓶颈。该方法在公开基准上达到 4,752 tokens/s,同时保持有竞争力的解析精度。
阅读全文NVIDIA 推出的 AV-Flamingo 面向长而复杂的真实世界音视频场景,不再只盯着短片段,而是强调跨模态、跨时间的联合推理。它通过大规模数据、分阶段训练和带时间戳的链式思考,在多项基准上表现出很强竞争力。
阅读全文Hallo4D 试图解决 3D 与 4D 生成中的空间和时间“幻觉”问题。它不改造底层生成模型,而是让多模态大模型充当一致性评审,发现问题并指导修正。
阅读全文KnowAct-GUIClaw 提出“Know Deeply, Act Perfectly”范式,试图补足 OpenClaw 在跨平台 GUI 交互和自我进化机制上的短板。该框架通过经验记忆、技能库与反思机制,让个人助手在 Android、iOS、HarmonyOS 和 Windows 等环境中提升任务执行能力。
阅读全文Boogu-Image-0.1 是一个面向图像理解、生成与编辑的开源统一多模态模型家族,包含 Base、Turbo、Edit 和 Edit-Turbo 等版本。论文强调,在有限算力下,通过数据、训练流程和推理时扩展优化,开源模型仍有机会接近闭源系统表现。
阅读全文FM² 试图解决医学影像基础模型训练中的两难:模型需要跨机构数据,但隐私与合规限制了集中汇聚。论文将重点放在不同医院、不同影像模态之间的结构性异质上,并提出联邦式统一训练方案。
阅读全文一篇 arXiv 论文提出 CF-Net,用视觉、音频与文本三路信息识别视频中的 ambivalence/hesitancy(矛盾与犹豫)。它的重点不是捕捉典型表情,而是建模不同模态之间的细微不一致。
阅读全文这篇 arXiv 论文提出 AgentHOI,把多模态大模型的推理能力引入开放场景中的人物—物体交互检测。它不再依赖固定类别训练,而是通过多轮语义推理与定位模块协作来发现交互关系。
阅读全文一篇 arXiv 新论文提出以“切片级数据合成”构建结构化推理数据,帮助2D预训练医学多模态大模型理解3D体数据。该方法试图在不进行昂贵3D专用预训练的前提下,提升模型的空间追踪与临床推理能力。
阅读全文AspectCLIP 针对 CLIP 训练中的图文信息不对称问题提出改进:同一张图像可能包含多个可描述侧面,而文本往往只覆盖其中之一。它通过按文本属性聚类来约束一致性正则,减少语义错配对表示空间的干扰。
阅读全文Thinking Machines 的 Inkling 已在 Hugging Face 上线,这是一个面向图像、文本和音频原生输入的开放多模态大模型。它以约 1T 参数、1M 上下文和稀疏 MoE 架构为主要卖点,定位于复杂多模态推理与下游微调。
阅读全文