返回文章列表
推理与部署

Daedalus-150M:为普通 CPU 推理反向设计的卷积—注意力混合模型

阅读约 3 分钟

导语

小语言模型通常沿用大模型的 Transformer 结构,训练完成后再通过量化、剪枝或运行时优化塞进 CPU。Daedalus-150M 采取了相反路径:先假定模型服务于单用户、一次生成一个 token、使用 4-bit 权重并运行在普通 CPU 上,再反过来选择架构。这个思路的重点不是单纯减少参数,而是减少长上下文解码时反复读取缓存的部分。

核心设计:只保留必要的全注意力

Daedalus-150M 约有 160M 参数,共 18 个模块,其中 6 个保留完整注意力,另外 12 个使用短的深度卷积。卷积模块的递归状态只覆盖两个时间步,因此无论对话上下文增长到多长,这部分网络都不会持续读取不断膨胀的 KV cache。全注意力仍负责跨位置的信息交互,卷积则承担一部分局部、连续的序列处理任务。

这种安排带来两个直接效果:一是模型仍保有一定的全局建模能力,二是长上下文下的内存访问压力不会随着每一层都同步增长。论文还指出,空上下文时混合模型与全注意力模型的速度差距接近于零,而上下文变长后优势逐步扩大。这一趋势与缓存机制的解释相符,而不只是“模型更小”造成的表面收益。

训练与对照结果

模型从头训练使用了 599 亿 tokens,在 HellaSwag、ARC-Easy、PIQA、OpenBookQA 和 WinoGrande 五项任务上取得 47.31 分,高于训练前设定的 42.20 基准。它超过了 GPT-2 124M、Pythia-160M、OPT-125M 和 GPT-Neo-125M,且这些模型使用了约 3 至 6 倍的训练数据;其成绩也高于公开的 MobileLLM-125M 结果。验证集 bits-per-byte 为 0.8685。

为尽量隔离架构因素,作者还训练了一个参数规模匹配、数据和训练条件相同的全注意力模型,并预先规定比较标准。混合架构在主要质量指标上高出 0.81%,下游任务表现持平,4-bit 文件体积小 6.3%;在 2048 token 上下文下,解码速度达到对照模型的 1.76 倍,相比外部同规模模型为 2.08 倍。仅按带宽估算只能得到 1.17 倍,因此速度提升并不能完全由搬运更少数据解释。

仍需补足的证据

这项工作也记录了失败尝试,包括量化感知训练早期出现的明显 4-bit 质量损失、约半数卷积通道变得不活跃,以及受现有运行时形状检查限制而难以直接剪枝。此外,公开摘要没有给出具体 CPU 型号、批大小和绝对 token/s 或延迟数字。对实际部署者而言,这些信息比相对加速比更能判断模型是否值得替换现有方案。

意义与影响

Daedalus-150M 的价值在于提出了一种可复用的设计顺序:部署目标不应只是模型压缩的终点,也可以成为架构搜索的起点。它并未证明卷积能够普遍取代注意力,而是说明在小模型、单流解码和长上下文场景中,混合结构可能比“缩小版标准 Transformer”更匹配 CPU 的内存访问特征。后续仍需要不同处理器、运行时和真实应用负载上的复现,才能判断这一优势能否稳定转化为用户可感知的体验。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Llama-Mobile:用2.7比特量化把视觉语言模型带到移动端
推理与部署
cctest.ai
推理与部署

Llama-Mobile:用2.7比特量化把视觉语言模型带到移动端

Llama-Mobile提出一套面向移动部署的视觉语言模型量化方案,结合模型自生成数据与适配Arm CPU的2.7比特格式,将Llama 3.2 11B Vision Instruct压缩至3.7 GB。实验显示,在8比特激活下,模型在多项标准视觉问答任务中仍保持较强表现。

阅读全文