返回文章列表
推理与部署

Qwen 3.8 27B 接入 Cerebras,公开端点速度约 1500 tokens/s

阅读约 2 分钟

导语

Cerebras 在其公开模型目录中列出了 Qwen 3.8 27B,并为该模型提供名为 qwen-3.8-27b 的 API 标识。按照页面信息,模型参数规模为 270 亿,公开端点标称生成速度约为 1500 tokens/s。该服务覆盖免费试用和按量付费层,但具体调用仍需遵守对应的速率限制与价格规则。

核心要点

  • 面向公开 API 提供:Qwen 3.8 27B 可通过 Cerebras 的公共端点调用,适用于首次接入、原型验证和按量使用场景。
  • 上下文容量分层:免费层上下文上限为 64K,付费层为 128K。页面没有进一步说明不同套餐的完整限流和计费细节,用户仍需查看价格与服务限制。
  • 强调低延迟推理:Cerebras 给出的速度约为 1500 tokens/s。该数字是平台目录中的标称值,实际体验可能取决于请求长度、并发、网络以及账户层级。
  • 公开端点不使用剪枝模型:Cerebras 表示,当前公开端点提供原始、未剪枝版本,不会在未通知的情况下改变模型架构。其 REAP 剪枝模型仅通过 Hugging Face 面向研究与实验提供。
  • 采用存储侧选择性量化:模型权重在存储时使用部分 16 位、8 位和 4 位表示;对质量敏感的层保留更高精度,并在运行时执行反量化。激活值、注意力和 KV Cache 则保持未量化状态。

这意味着什么

对开发者而言,Qwen 3.8 27B 的加入扩大了 Cerebras 公开端点的模型选择。相较于自行准备推理基础设施,直接调用 API 可以降低部署和运维门槛;而较高的标称生成速度,则更适合需要快速返回的交互式应用、批量实验和模型对比测试。

不过,速度并不等同于端到端延迟。首 token 时间、排队情况、网络往返和输出长度都会影响实际结果。免费试用层也存在速率限制,因此生产系统在评估时应同时测试并发能力、上下文使用方式和错误重试策略。

Cerebras 对压缩策略的披露同样值得关注。平台将量化与剪枝明确区分:前者主要改变数字表示精度,后者则会移除模型结构中的部分组件。通过承诺公开端点保持原始模型,并将潜在的剪枝版本以独立名称提供,用户能够更清楚地判断自己调用的模型版本。需要注意的是,文档只确认了可用性、上下文和压缩方式,并未提供该模型的独立质量评测,因此性能选择仍应建立在实际任务测试之上。

来源:Hacker News

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
让语言模型自己决定看哪里:Declarative Attention如何减少长上下文开销
推理与部署
cctest.ai
推理与部署

让语言模型自己决定看哪里:Declarative Attention如何减少长上下文开销

KAIST AI团队提出Declarative Attention,让语言模型在生成过程中声明需要访问的上下文区域,从而跳过大量KV缓存读取。初步评测显示,这种方法能显著降低注意力读取量,但会带来小幅准确率下降。

阅读全文