返回文章列表
多模态

DeepSeek 开放视觉实验模型,多模态能力补上关键一块

阅读约 2 分钟

导语

DeepSeek 正在把 V4 系列从“文本与代码模型”推向更完整的多模态 Agent 平台。近日,DeepSeek API 上线实验模型 deepseek-v4-flash-vision-exp,开始提供图像理解服务。这是 V4 系列首次通过官方 API 明确开放视觉输入,也意味着开发者可以直接把图片纳入 DeepSeek 驱动的 Agent、自动化流程和代码工具链。

核心要点

  • 视觉输入正式开放:模型支持图文混合请求,图片可通过 base64 内联、外部 URL 或 Files API 传入。
  • 接入方式较完整:API 兼容 Chat Completions、Messages 和 Responses 三种格式,便于接入现有 Agent 框架。
  • 按视觉 token 计费:图片会转换为 token 参与计费,单张图片最多占用 384 tokens,价格与 V4-Flash 保持一致。
  • Agent 测试多数提升:相较 V4-Flash-0731,七项测试中有五项提升、一项小幅下降。

从结果看,Vision-Exp 并不只是给原有语言模型外挂一个视觉编码器。Toolathlon-Verified 从 70.3 分升至 75.9 分,DeepSWE 从 54.4 分升至 59.3 分,提升分别达到 5.6 分和 4.9 分。这两项测试都涉及工具调用、真实代码库修改或持续执行任务,因此变化更像是模型在理解外部环境、拆解任务和执行工具链方面出现了协同增强。

其他指标也呈现类似趋势:Terminal Bench 2.1 从 82.7 升至 83.9,NL2Repo 从 54.2 升至 57.7,DSBench-Hard 从 59.6 升至 63.6,AutomationBench 从 25.1 升至 25.7。Cybergym 则由 76.7 降至 75.3,说明新模型并非在所有任务上都单向进步。

意义与影响

对开发者来说,视觉输入的开放首先降低了多模态 Agent 的接入门槛。截图分析、界面操作、文档理解和视觉辅助编程等场景,现在可以沿用较熟悉的 API 调用模式完成,而不必额外拼接独立的视觉模型。图片上限和 token 计费规则也为成本估算提供了相对清晰的依据。

不过,Vision-Exp 与 Opus 4.8 的对比仍然说明,DeepSeek 尚未在文本 Agent 能力上全面领先。它在 DeepSWE 上以 59.3 分超过 Opus 4.8 的 58.0 分,在 Toolathlon 上的 75.9 分也只低 0.3 分;但 NL2Repo 和 DSBench-Hard 分别落后 12 分和 8.1 分。更稳妥的判断是,它已经接近领先模型,并在部分代码 Agent 场景展现竞争力。

需要注意的是,模型名称仍保留“Exp”后缀,官方也将其定义为实验版本。未来还要观察视觉理解的稳定性、复杂图片任务的实际效果、API 服务可靠性以及成本表现。无论最终结果如何,这次上线都标志着 DeepSeek V4 开始补齐多模态能力拼图,并把视觉理解与 Agent 执行放在同一条产品路径上。

InfoQ 中文

评论

正在确认登录状态……

正在加载评论……

相关文章