文章与教程

推理与部署

Claude API 中转站避坑指南、检测原理与大模型 API 实测经验

共 40 篇文章

CCTest · Blog
让语言模型自己决定看哪里:Declarative Attention如何减少长上下文开销
推理与部署
cctest.ai
推理与部署

让语言模型自己决定看哪里:Declarative Attention如何减少长上下文开销

KAIST AI团队提出Declarative Attention,让语言模型在生成过程中声明需要访问的上下文区域,从而跳过大量KV缓存读取。初步评测显示,这种方法能显著降低注意力读取量,但会带来小幅准确率下降。

阅读全文
CCTest · Blog
企业为何要把200多个应用的请求,集中到一个自托管模型上?
推理与部署
cctest.ai
推理与部署

企业为何要把200多个应用的请求,集中到一个自托管模型上?

一项企业级实践尝试用生产流量反向驱动后训练,将指令遵循、函数调用和内部任务分布拆成三个优化方向,再通过模型合并形成统一模型。结果显示,小得多的模型在内部评测和实际服务覆盖上具备竞争力。

阅读全文
CCTest · Blog
Daedalus-150M:为普通 CPU 推理反向设计的卷积—注意力混合模型
推理与部署
cctest.ai
推理与部署

Daedalus-150M:为普通 CPU 推理反向设计的卷积—注意力混合模型

Daedalus-150M 没有把大模型架构缩小后再适配 CPU,而是先锁定单用户、单 token、4-bit 权重等部署条件,再决定网络结构。它用短卷积替代三分之二的全注意力模块,在长上下文下实现更稳定的缓存开销和更高解码速度。

阅读全文
CCTest · Blog
Llama-Mobile:用2.7比特量化把视觉语言模型带到移动端
推理与部署
cctest.ai
推理与部署

Llama-Mobile:用2.7比特量化把视觉语言模型带到移动端

Llama-Mobile提出一套面向移动部署的视觉语言模型量化方案,结合模型自生成数据与适配Arm CPU的2.7比特格式,将Llama 3.2 11B Vision Instruct压缩至3.7 GB。实验显示,在8比特激活下,模型在多项标准视觉问答任务中仍保持较强表现。

阅读全文