MOSS-VL:让视觉语言模型在说话时持续看见世界
导语
传统视觉语言模型往往按照“输入完整画面—生成答案”的离线流程工作,但实时助手面对的是不断到来的视频帧:它既要持续观察,又不能因为等待全部视觉信息而停止回应。MOSS-VL Technical Report 将“边看边说”定义为一等能力,试图解决流式多模态交互中的架构、训练和延迟问题。
核心设计
- 用门控交叉注意力接入视觉信息。 MOSS-VL 的语言解码器并不把视觉 token 直接混入正在生成的序列,而是通过 gated cross-attention 访问视觉特征。这样,模型在输出过程中仍可接收后续帧,视觉上下文也不会简单地挤占解码序列。
- 训练模型决定是否开口。 项目构造了合成交互语料,专门监督模型何时应该主动说话、何时保持安静,以及发现新信息后如何修正先前判断。这一点区别于只训练“看图回答”的模型,也更贴近实时助手的实际行为。
- 把实时能力放到轻量的最后阶段。 研究采用分阶段课程学习,先利用较强的离线基础模型建立通用视觉语言能力,再在最终阶段集中进行实时交互训练。其目标是在减少专门训练成本的同时,避免实时能力破坏原有的离线表现。
评测表现与效率
报告称,MOSS-VL-Instruct 在相近规模的离线任务上具备竞争力,并在时间推理视频数据集上表现突出。在四项流式基准中,MOSS-VL-Realtime 在其中三项取得开放源流式模型的最佳平均成绩,在第四项排名第二。对于专门考察主动行为的三个子集,它全部取得领先;例如在 OmniMMI Proactive Alerting 上得分为 66.0,而最佳基线为 37.5。
模型规模为 11.3B 参数。由于视觉 token 不进入解码序列,随着视觉上下文增长,MOSS-VL 相较同一骨干的 Qwen3-VL-8B,在 time-to-first-token 指标上的优势从 2.8 倍扩大到 5.1 倍。这里的结果重点并非单纯追求更大模型,而是说明视觉信息接入方式会直接影响实时响应速度。
意义与局限
MOSS-VL 的价值在于把实时多模态交互拆成可复用的系统设计:架构负责持续看,数据负责学习何时行动,课程学习负责控制适配成本。它为视频助手、主动提醒和其他需要连续感知的应用提供了开放实现,也让“主动性”从宣传概念变成可测量的评测维度。
不过,现有材料主要给出了总体排名、代表性分数和延迟对比,未提供各基准的完整配置、硬件环境及误差分析。因此,实际部署时仍需进一步验证吞吐、长时间运行稳定性,以及模型在复杂场景中主动发言和修正的可靠程度。项目已发布五个检查点、训练课程和实时推理代码,后续复现与横向测试将有助于判断其工程优势能否稳定延续。
评论
正在确认登录状态……
正在加载评论……