返回文章列表
模型发布

DeepSeek-V4-Flash API 公测:后训练升级带来 Agent 能力跃升

阅读约 2 分钟

导语

DeepSeek-V4-Flash 官方 API 已正式上线公测。与许多“新版本”通过扩大参数、调整上下文长度来制造差异不同,这次更新的关键信息在于:模型结构与参数规模保持不变,仍为 MoE 284B、激活 13B,并支持 100 万 token 上下文;真正发生变化的是后训练流程。换句话说,DeepSeek 试图证明,在既有底座上继续优化对齐、任务执行与工具调用能力,也能带来可感知的跃升。

核心要点

  • 基础规格未变:素材显示,DeepSeek-V4-Flash 仍沿用 MoE 284B、激活 13B 的设定,并保留 100 万 token 上下文窗口。这意味着新版提升并非来自更大的模型规模或更长的上下文。
  • 后训练成为主角:此次“正式版”主要重新做了后训练。对于面向开发者的 API 来说,这类改动往往会直接影响模型在多步骤任务、工具使用、代码修改和命令行环境中的稳定性。
  • Agent 基准表现提升明显:摘要提到,新版在九项 Agent 基准测试中全部超过 DeepSeek 4 月发布的 Pro Preview。其中 Terminal Bench 2.1 从 61.8 提升到 82.7,DeepSWE 从 7.3 提升到 54.4,显示其在终端操作与软件工程任务上有显著进步。
  • API 公测降低试用门槛:官方 API 进入公测,意味着开发者和企业可以更直接地把该模型接入应用、工作流或评测体系,观察其在真实场景中的表现。

意义与影响

DeepSeek-V4-Flash 的看点不只是“又一个模型上线”,而是它把模型迭代的重点放在了 Agent 能力上。当前大模型竞争正在从单轮问答、通用知识问答,转向能否完成复杂任务:理解目标、拆解步骤、调用工具、处理反馈,并在错误发生后继续修正。Terminal Bench 与 DeepSWE 这类指标之所以受到关注,正是因为它们更接近开发者关心的真实工作流。

如果素材中的评测表现能在更多第三方测试和实际应用中得到验证,那么 DeepSeek-V4-Flash 可能会成为开发者测试智能体、代码助手、自动化运维和长上下文任务的一个新选择。尤其是在模型规模不变的前提下获得提升,也提示行业:后训练、任务数据与评测闭环仍有很大优化空间。

不过,公测阶段仍需要谨慎看待。基准测试能够说明趋势,但不能完全等同于生产环境效果。不同应用对稳定性、成本、延迟、工具调用成功率和安全边界的要求并不相同。真正的答案,还要等开发者在真实项目中进行更广泛的验证。

来源:OSChina

评论

正在确认登录状态……

正在加载评论……

相关文章