返回文章列表
模型发布

Claude Opus 5 发布:主打高性价比的前沿编码与知识工作模型

阅读约 3 分钟

导语

Anthropic 宣布推出 Claude Opus 5。按照官方说法,这款模型的定位并不是单纯追求最高上限,而是在接近 Claude Fable 5 前沿智能的同时,把使用成本控制在约一半水平,成为更适合日常高频使用的旗舰级模型。它已经成为 Claude Max 的默认模型,也是 Claude Pro 中能力最强的模型。

需要注意的是,当前信息主要来自 Anthropic 的产品公告、系统卡以及早期客户反馈,因此更适合视为厂商口径下的首轮观察,而不是独立第三方结论。

核心要点

  • 性能与成本的组合是主线:Anthropic 称,Opus 5 在与前代 Opus 4.8 相同成本下有显著提升,并提供不同 effort 设置,让用户在智能水平、速度和 token 成本之间取舍。
  • 编码任务表现突出:在 Frontier-Bench v0.1 上,官方称 Opus 5 超过其他模型,并以更低单任务成本将 Opus 4.8 的表现提升到两倍以上;在 CursorBench 3.2 上,最高 effort 下接近 Fable 5 峰值分数,成本约为一半。
  • 代理式知识工作增强:在 Zapier AutomationBench、OSWorld 2.0、GDPval-AA v2、DeepSearchQA 等任务中,Opus 5 被描述为更能完成端到端业务流程、桌面操作和复杂知识工作。
  • 更强调自我验证:官方案例中,Opus 5 会为不可直接查看的机械图纸编写计算机视觉流程,或在缺少实时数据源时搭建测试框架,以验证自己的代码输出。
  • 科学任务有所改进:在生命科学内部评测中,它相较 Opus 4.8 在结构生物学、有机化学、生物信息学等方向均有提升,其中有机化学和蛋白相关任务提升更明显。
  • 仍有短板:公告明确提到,Opus 5 在网络安全任务上仍落后于 Mythos 5,这说明其并非在所有专业高风险领域都达到同一水准。

意义与影响

Opus 5 的发布反映出大模型竞争正在从“最高分模型”转向“可持续使用的智能”。企业和开发者真正关心的往往不是单次跑分,而是复杂任务能否稳定完成、是否会主动检查错误、能否减少人工拆解步骤,以及成本是否可控。

从素材看,Anthropic 试图把 Opus 5塑造成一个适合代理式编程、自动化办公、金融研究和科学分析的通用工作模型。它的差异点不只是生成答案,而是更主动地验证环境、编写测试、迭代方案,并在长链路任务中保持稳定。若这些能力在第三方实测中得到验证,Opus 5 可能会提升 AI 编程助手和企业智能体的可用性门槛。

不过,官方公告中的大量结果来自内部评测和早期客户表述,仍需要更多公开、可复现、跨场景的测试来判断其真实优势。尤其是在高风险领域,模型的“能做更多事”也意味着更需要清晰的权限控制、审计和安全边界。

来源:Hacker News

评论

正在确认登录状态……

正在加载评论……

相关文章