返回文章列表
大语言模型

字节跳动押注超大模型:10 万亿参数竞逐 Anthropic

阅读约 2 分钟

字节跳动正在加码大模型竞赛,而且这次瞄准的是全球最前沿的参数规模。据报道,这家公司正在训练一款最多可达 10 万亿参数 的模型,若最终成型,其体量将明显超过中国已发布的最大模型之一,也被视为向 Anthropic 最先进系统发起挑战的重要尝试。

核心要点

  • 该模型目前仍处于预训练阶段,通常需要三到六个月,之后才会进入微调和发布环节。
  • 业内估计,Anthropic 最先进的 Mythos 5 约为 8 万亿参数,Fable 5 约为 5 万亿参数;字节的目标已经进入同一量级甚至更高区间。
  • 参数规模并不等于最终能力,但它决定了模型可容纳的基础容量与记忆上限,后续还取决于数据质量和训练方法。
  • 字节的 AI 团队 Seed 采取更独立的研发路线,不再依赖“蒸馏”其他实验室模型,这被认为速度更慢,但有助于建立更强的自主能力。
  • 公司在 AI 上的投入持续扩大,既包括数据中心与研究团队,也包括云业务 Volcano Engine 和自研芯片布局。

这意味着什么

这条消息反映出中国头部科技公司在前沿 AI 领域的竞争正在升温。过去,外界更多关注中美模型在应用层和产品层的追赶;而现在,竞争已经推进到更底层的训练规模、基础设施和组织能力。

对字节跳动来说,押注超大参数模型有两层意义:第一,它可以强化 Doubao、云服务和企业 AI 方案的技术底座;第二,它说明公司并不满足于做“追赶者”,而是希望在下一代基础模型上争取领先。

不过,单纯放大参数并不保证成功。真正决定模型表现的,仍是训练数据、算力调度、工程效率和后续对齐能力。换句话说,10 万亿参数只是入场券,能否把规模转化为实用能力,才是字节接下来最关键的考验。

Ars Technica AI

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Multi-Head Attention Residuals:让 Transformer 的残差通路也拥有多头路由
大语言模型
cctest.ai
大语言模型

Multi-Head Attention Residuals:让 Transformer 的残差通路也拥有多头路由

这篇论文提出 Multi-Head Attention Residuals(MHAR),试图解决 Transformer 残差流只能以单一方式读取深度历史的问题。它用按特征子空间拆分的多头 softmax 做层间路由,在几乎不增加参数和计算的情况下改善验证损失。

阅读全文