返回文章列表
多模态

DeepSeek V4-Flash 补上视觉能力,多模态 Agent 迈向更高水平

阅读约 2 分钟

导语

DeepSeek 正在为 V4-Flash 补齐视觉输入能力。最新公布的实验性版本名为 DeepSeek-V4-Flash-Vision-Exp,目前已经通过 deepseek-v4-flash-vision-exp 这一 model id 在 DeepSeek API 平台开放调用。与单纯发布一个新模型相比,这次更新更像是把 V4-Flash 的文本与 Agent 能力延伸到图像场景。

核心要点

  • 视觉能力正式加入:V4-Flash-Vision-Exp 面向需要理解图像内容的应用,重点补足原有版本的视觉能力。
  • 纯文本能力保持不变:素材强调,该实验版本在 Agent、推理和世界知识等纯文本维度上没有降级,仍延续 V4-Flash 的基础能力。
  • 已提供 API 调用入口:开发者可以通过指定的 model id 接入测试,但实验版本意味着稳定性、兼容性与最终形态仍可能继续调整。
  • 多模态 Agent 的基础更完整:当模型既能处理文字,又能理解图像时,文档分析、界面操作、视觉问答以及带图片输入的工作流都具备了进一步扩展的条件。

这意味着什么

对于开发者而言,视觉能力的加入降低了在文本模型和视觉模型之间切换的必要性。一个能够保持原有推理和 Agent 表现、同时接收图像输入的模型,更适合被嵌入复杂工作流:用户可以用自然语言提出任务,再附上截图、照片或其他视觉材料,由同一模型完成理解和后续推理。

这也解释了为什么此次更新被放在多模态 Agent 的语境下观察。Agent 并不只是回答问题,还需要读取环境信息、识别任务状态并采取下一步行动。视觉输入可以让模型接触到文本之外的界面、图表和现实场景,从而拓宽自动化应用的边界。不过,当前公开信息主要说明了模型定位、调用方式和能力方向,并未给出完整的评测数据。因此,Vision-Exp 与其他视觉模型在准确率、延迟、成本及复杂任务稳定性上的差异,仍需等待更多测试验证。

从产品节奏看,DeepSeek 选择先以实验版本开放视觉能力,说明这项能力仍处于持续迭代阶段。开发者在接入时应把它视为测试性组件,关注接口变化与实际任务表现,而不宜仅依据“接近某一高水平模型”的描述做出定量判断。

来源:OSChina

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
SPARGen:把三维重建、稠密对应与空间推理统一到多模态生成框架中
多模态
cctest.ai
多模态

SPARGen:把三维重建、稠密对应与空间推理统一到多模态生成框架中

SPARGen 尝试用一个原生多模态生成模型处理多类空间任务,将三维重建、稠密对应和空间推理都转化为由指令驱动的生成问题。它的价值不在于单点任务刷新纪录,而在于让不同空间监督共同塑造同一套表示。

阅读全文