同一模型为何本地更“笨”?推理栈的数值差异才是关键
一项针对长上下文和工具调用的实验显示,即使权重、显卡和提示词相同,注意力后端、KV缓存精度、量化方案及多卡通信仍可能改变模型的下一枚Token。
阅读全文一项针对长上下文和工具调用的实验显示,即使权重、显卡和提示词相同,注意力后端、KV缓存精度、量化方案及多卡通信仍可能改变模型的下一枚Token。
阅读全文TileMix 将注意力矩阵划分为硬件友好的分数瓦片,并在同一个融合内核中为不同瓦片选择 FP16 或 INT8。它不裁剪 token 连接,在提升预填充效率的同时,试图弥补统一 INT8 带来的长上下文质量损失。
阅读全文结构化压缩叠加4比特量化,往往会损伤大模型的推理、数学、编程和长上下文能力。Multiverse Computing提出量化感知修复方法QAH,让量化学生模型直接向原始未压缩模型学习。
阅读全文Multiverse Computing 提出 Quantization-Aware Healing(QAH),让经过结构压缩和 4-bit 量化的模型直接向原始大模型学习。在 GPT-OSS 120B 压缩至 60B 的实验中,QAH 模型在 9 项基准中的 7 项超过同架构 BF16 模型。
阅读全文ParaTempo 提出一种无需训练的异步并行推理框架,通过观察各推理分支在多个时刻对答案空间的收敛程度,动态决定剪枝、提前退出和重新分叉。它试图在保持并行推理鲁棒性的同时,减少无效计算。
阅读全文Daedalus-150M 没有把大模型架构缩小后再适配 CPU,而是先锁定单用户、单 token、4-bit 权重等部署条件,再决定网络结构。它用短卷积替代三分之二的全注意力模块,在长上下文下实现更稳定的缓存开销和更高解码速度。
阅读全文Nexus 针对 MCP 智能体每轮重复编码工具 schema、导致首 token 延迟上升的问题,提出检索式工具路由与受控 KV-cache 拼接两条路径。实验显示,检索路径在工具规模扩大时更稳定,而 KV 拼接的收益受 RoPE 位置漂移限制。
阅读全文Llama-Mobile提出一套面向移动部署的视觉语言模型量化方案,结合模型自生成数据与适配Arm CPU的2.7比特格式,将Llama 3.2 11B Vision Instruct压缩至3.7 GB。实验显示,在8比特激活下,模型在多项标准视觉问答任务中仍保持较强表现。
阅读全文vLLM 发布实践指南,介绍如何在 AMD Instinct MI300X、MI355X 与 ROCm 环境中使用推测解码。文章对比原生 MTP、EAGLE-3、DFlash、DSpark 等方案,并强调接受率与工作负载对收益的决定性影响。
阅读全文FlashPrefill V2 面向长上下文模型的预填充阶段,引入均值校正、面向 GPU 的稀疏算子优化,以及对分页 KV Cache 和连续批处理的原生支持。在 NVIDIA H20 测试中,其相对 FlashAttention-2 在 128K 上下文下最高实现 47.26 倍加速。
阅读全文企业支出管理平台Ramp推出AI模型路由服务Router,通过统一API连接多家大模型,并提供按成本、性能和难度分配请求的策略。该服务目前仅在美国开放,2026年剩余时间免收路由服务费,但模型推理费用仍由用户承担。
阅读全文FreeToken 提出一种面向边缘设备的 MoE 服务系统,不再把个人电脑简单视为“缩小版 GPU”,而是将 CPU、GPU、内存与存储统一调度。论文展示了在消费级和工作站硬件上运行更大开放权重模型的可能性。
阅读全文牛津大学研究团队用 128 张二手 GPU 搭建 DumpsterCluster,验证了退役硬件服务大模型推理的可行性。研究同时指出,低采购成本并不等于低总成本,电价与电力碳强度将决定这类方案是否真正划算。
阅读全文一篇安全研究文章追踪了“token brokers”的兴起:他们从创业公司手中收购未用完的 AI API 额度,再以折扣形式转卖给其他买家。这个市场让推理额度开始具备“准货币”属性,也给云厂商、模型公司和合规团队带来新风险。
阅读全文LiveAnimate 试图解决一个长期矛盾:扩散式人像动画质量高,但生成太慢、记忆开销也会随时长膨胀。该工作把 14B 级视频 DiT 改造成可实时流式推理的系统,并兼顾长序列稳定性。
阅读全文UniMoMo 提出一种后训练压缩框架,把已训练的大型推荐 MoE 模型转换为更小的标准 MoE。它以专家在校准数据上的功能相似性和路由流量为依据,在尽量保持推荐效果的同时降低推理开销。
阅读全文vLLM 博客介绍了 Decode Context Parallelism(DCP)在长上下文解码阶段的价值:它按序列维度切分 KV cache,而不是只依赖张量并行按注意力头切分。对于 64K 到 1M token 的智能体轨迹负载,这一机制显著提升并发与吞吐。
阅读全文GPTQ-2D 研究的是一种更一般的矩阵量化舍入问题:误差不仅受左侧基矩阵影响,也受右侧基矩阵影响。论文给出一种按反对角线推进的算法,在保持结果与向量化朴素做法一致的同时,将时间复杂度降为三次。
阅读全文OmniScope 提出一种免训练的全模态大模型 Token 压缩框架:查询可以作为共同语义锚点,但音频与视频的相关性应分别估计。它在 25% Token 保留率下实现最高 3.53 倍 prefill 加速,同时平均准确率几乎不变。
阅读全文