文章与教程

推理与部署

Claude API 中转站避坑指南、检测原理与大模型 API 实测经验

共 29 篇文章

CCTest · Blog
Daedalus-150M:为普通 CPU 推理反向设计的卷积—注意力混合模型
推理与部署
cctest.ai
推理与部署

Daedalus-150M:为普通 CPU 推理反向设计的卷积—注意力混合模型

Daedalus-150M 没有把大模型架构缩小后再适配 CPU,而是先锁定单用户、单 token、4-bit 权重等部署条件,再决定网络结构。它用短卷积替代三分之二的全注意力模块,在长上下文下实现更稳定的缓存开销和更高解码速度。

阅读全文
CCTest · Blog
Llama-Mobile:用2.7比特量化把视觉语言模型带到移动端
推理与部署
cctest.ai
推理与部署

Llama-Mobile:用2.7比特量化把视觉语言模型带到移动端

Llama-Mobile提出一套面向移动部署的视觉语言模型量化方案,结合模型自生成数据与适配Arm CPU的2.7比特格式,将Llama 3.2 11B Vision Instruct压缩至3.7 GB。实验显示,在8比特激活下,模型在多项标准视觉问答任务中仍保持较强表现。

阅读全文
CCTest · Blog
FlashPrefill V2:把长上下文稀疏注意力推进到实际部署
推理与部署
cctest.ai
推理与部署

FlashPrefill V2:把长上下文稀疏注意力推进到实际部署

FlashPrefill V2 面向长上下文模型的预填充阶段,引入均值校正、面向 GPU 的稀疏算子优化,以及对分页 KV Cache 和连续批处理的原生支持。在 NVIDIA H20 测试中,其相对 FlashAttention-2 在 128K 上下文下最高实现 47.26 倍加速。

阅读全文
CCTest · Blog
Ramp推出AI模型路由服务Router,瞄准企业推理成本与模型切换
推理与部署
cctest.ai
推理与部署

Ramp推出AI模型路由服务Router,瞄准企业推理成本与模型切换

企业支出管理平台Ramp推出AI模型路由服务Router,通过统一API连接多家大模型,并提供按成本、性能和难度分配请求的策略。该服务目前仅在美国开放,2026年剩余时间免收路由服务费,但模型推理费用仍由用户承担。

阅读全文
CCTest · Blog
退役 GPU 还能做什么?DumpsterCluster 探索用二手硬件运行 LLaMA-70B
推理与部署
cctest.ai
推理与部署

退役 GPU 还能做什么?DumpsterCluster 探索用二手硬件运行 LLaMA-70B

牛津大学研究团队用 128 张二手 GPU 搭建 DumpsterCluster,验证了退役硬件服务大模型推理的可行性。研究同时指出,低采购成本并不等于低总成本,电价与电力碳强度将决定这类方案是否真正划算。

阅读全文
CCTest · Blog
OmniScope:让全模态大模型压缩音视频 Token 时不再“互相误导”
推理与部署
cctest.ai
推理与部署

OmniScope:让全模态大模型压缩音视频 Token 时不再“互相误导”

OmniScope 提出一种免训练的全模态大模型 Token 压缩框架:查询可以作为共同语义锚点,但音频与视频的相关性应分别估计。它在 25% Token 保留率下实现最高 3.53 倍 prefill 加速,同时平均准确率几乎不变。

阅读全文