返回文章列表
多模态

SenseNova-U1.5:把视觉理解、推理与生成放进同一个模型

阅读约 3 分钟

导语

当前多模态模型往往将“看图”和“画图”拆成不同模块:视觉编码器负责理解图像,生成器或 VAE 负责把内部表示还原为像素。SenseNova-U1.5 代表了另一条路线。论文介绍的这一 8B-MoT 模型试图在不使用视觉编码器和 VAE 的架构中,统一完成视觉理解、推理与生成。

核心要点

  • 原生统一架构:模型不把视觉输入与输出完全交给外部编码、解码组件,而是围绕统一的多模态建模流程处理视觉内容。其目标不仅是识别图像,还包括根据指令规划并生成结果。
  • 改善视觉接口:研究引入空间上更连贯的 patch 重建机制,使模型在处理图像局部与整体关系时拥有更稳定的视觉表示。论文将其视为连接理解与生成的重要基础。
  • 训练数据与任务设计并重:训练阶段使用经过筛选的图像生成和编辑数据,并调整任务形式、增强结构化提示,同时支持最高 4K 的原生分辨率。这些设计主要针对复杂布局、细节保真和长指令执行。
  • 专家能力再整合:后训练阶段分别优化视觉审美、双语文字渲染、信息图生成和图像编辑等专门能力,再通过多专家 on-policy 蒸馏将能力合并到统一模型中。
  • 编辑与组合能力:根据论文摘要,模型在主体身份保持、几何关系、未修改区域保护、多参考编辑和复杂构图方面取得改进,也提升了交错式图文生成和指令遵循表现。

为什么值得关注

SenseNova-U1.5 的重点不只是“生成更好看的图片”,而是尝试缩短视觉理解、规划和创作之间的链路。传统模块化方案便于分别优化,但不同组件之间可能出现信息损失:模型看到了什么、准备如何修改,以及最终如何生成,未必共享同一套表示。原生统一建模则希望让这些步骤在一个端到端系统中相互迁移。

论文尤其强调,模型在生成数据中接触结构化格式有限的情况下,仍能处理较长、复杂和结构化的视觉指令。这一结果若能在更广泛的公开评测中复现,意味着多模态理解能力可能不仅服务于问答,也能转化为视觉规划能力。不过,现有材料主要提供研究方的总体结论,没有列出具体基准、分数或与各类模型的逐项对比,因此不宜据此直接判断其全面领先。

研究团队表示将开源监督微调、强化学习和 on-policy 蒸馏等训练代码。若代码和模型资源按计划发布,社区将有机会进一步验证其无编码器、无 VAE 路线的实际效率、可复现性与适用边界。对行业而言,这项工作提供了一个清晰方向:未来的视觉模型可能不再严格区分“理解模型”和“生成模型”,而是朝着能看、能想、能改、能创作的统一系统演进。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章