返回文章列表
模型发布

蚂蚁百灵发布 Ling-3.0-Flash:小激活参数瞄准 Agent 推理效率

阅读约 3 分钟

导语

7 月 24 日,蚂蚁百灵发布新一代原生混合推理模型 Ling-3.0-Flash。相比单纯追求更大参数规模,这次更新更强调“少激活、强推理、好部署”:模型总参数量为 124B,但单次计算激活参数仅 5.1B,试图在能力、延迟与算力成本之间取得更现实的平衡。

核心要点

  • 参数规模与计算开销分离:Ling-3.0-Flash 采用大总量参数配合低激活计算的路线,在保持模型容量的同时降低单次推理成本。官方称其在基础推理、指令遵循和长文本处理等指标上,可对标甚至超过更大规模行业模型。
  • 面向 Agent 场景优化:该模型扩展了超过 10000 个真实交互训练环境,重点强化复杂任务拆解、自我纠错和长程规划能力。对于代码编写、多源信息调研、连续任务执行等场景,目标是减少模型在长任务中“跑偏”或中途断档的问题。
  • 混合注意力架构成为效率关键:Ling-3.0-Flash 在预训练阶段采用混合注意力设计,以 5:1 的比例交替堆叠 KDA 线性注意力层与 MLA 层,兼顾长上下文处理效率和模型表达能力。
  • KDA 强化长文档记忆:模型将上一代 Lightning Attention 升级为 KDA(Kimi Delta Attention),在 Delta Rule 状态更新中加入细粒度对角门控,使模型处理长文档、代码库时更容易保留关键信息。
  • 专家激活进一步压缩:每个 Token 的专家激活比例从前代的 1/32 降至 1/64,意味着同等总参数规模下,实际参与计算的部分更少,有利于降低推理资源消耗。
  • 工程层面配套提速:百灵还引入集群级分级缓存,减少长对话、多轮交互中的重复计算。原文称,在长输入下首字响应延迟可降低 60% 至 80% 以上;多智能体协同架构则用于分工、校验与降低单一模型误判风险。

意义与影响

Ling-3.0-Flash 的看点不只是“又一个大模型发布”,而是延续了当前大模型行业从“堆参数”转向“堆效率”的趋势。对企业级 Agent 来说,模型能否稳定完成长流程任务,往往比单轮问答跑分更关键;而延迟、成本和上下文处理能力,又直接决定其能否进入高频业务系统。

如果后续开源兑现,Ling-3.0-Flash 可能为开发者提供一个更偏工程落地的选择:既能测试复杂 Agent 流程,也能观察混合注意力、低专家激活和缓存架构在真实任务中的效果。需要注意的是,当前公开信息主要来自厂商发布与授权转载,模型在开放评测、真实业务负载和第三方复现中的表现,仍有待进一步验证。

来源:量子位

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Claude Opus 5 发布:主打高性价比的前沿编码与知识工作模型
模型发布
cctest.ai
模型发布

Claude Opus 5 发布:主打高性价比的前沿编码与知识工作模型

Anthropic 发布 Claude Opus 5,将其定位为接近 Claude Fable 5 智能水平、但成本约为一半的日常主力模型。它在编码、自动化、知识工作和部分科学任务上展示了明显提升,但相关数据主要来自官方评测与早期客户反馈。

阅读全文