RTX 4060 跑 35B 模型每秒 39 Token,FreeToken 想重做本地 MoE 推理
伯克利与 MIT 研究人员开源 FreeToken,通过带宽自适应调度、权重双缓冲和弹性显存管理,尝试让消费级 GPU 更高效地运行大型 MoE 模型。论文称,RTX 4060 笔记本运行 Qwen3.6-35B 时可达到约每秒 39 个 Token。
阅读全文伯克利与 MIT 研究人员开源 FreeToken,通过带宽自适应调度、权重双缓冲和弹性显存管理,尝试让消费级 GPU 更高效地运行大型 MoE 模型。论文称,RTX 4060 笔记本运行 Qwen3.6-35B 时可达到约每秒 39 个 Token。
阅读全文一项针对混合架构27B模型的实验显示,Gated DeltaNet并不必然需要保留8或16比特精度。将全部496个线性层统一量化为NVFP4 W4A4后,模型在多项任务和长上下文检索中仍接近BF16表现。
阅读全文Cerebras 文档显示,Qwen 3.8 27B 已加入其公开推理端点,免费试用和按量付费用户均可使用,标称速度约为 1500 tokens/s。平台同时披露了上下文限制、量化方式及模型完整性策略。
阅读全文英伟达发布开源软件 Personal AI Router(PAIR),可发现并连接家庭网络中的兼容电脑,用闲置算力协同处理本地 AI 推理任务。它不是硬件路由器,而是一套面向 Ollama、LM Studio 等工具的本地计算调度方案。
阅读全文CRISP 针对长上下文自注意力预填充的动态稀疏问题,提出结构代理指标和感知注意力汇聚点的阈值策略。在多个长上下文基准上,它在降低注意力开销的同时改善了检索任务表现。
阅读全文KAIST AI团队提出Declarative Attention,让语言模型在生成过程中声明需要访问的上下文区域,从而跳过大量KV缓存读取。初步评测显示,这种方法能显著降低注意力读取量,但会带来小幅准确率下降。
阅读全文一项企业级实践尝试用生产流量反向驱动后训练,将指令遵循、函数调用和内部任务分布拆成三个优化方向,再通过模型合并形成统一模型。结果显示,小得多的模型在内部评测和实际服务覆盖上具备竞争力。
阅读全文NAVER AI Lab提出Verification-Aware Training(VAT),把推测解码中的顺序验证过程引入草稿模型训练。该方法在不修改模型架构和推理流程的前提下,提升了候选 token 的平均接受长度与实际加速效果。
阅读全文vLLM-Omni 对 MiniMax H3 的优化显示,多模态视频生成的瓶颈贯穿编码、扩散、VAE 解码、跨进程传输和 MP4 封装。进一步接入 FastVideo 的 FastH3 后,四次 DiT 前向即可将完整视频响应压缩到接近播放时长。
阅读全文一项研究比较了改造后的线性注意力模型与带注意力汇的滑动窗口注意力,发现后者在多项任务上表现相当或更好,长上下文推理优势尤其明显。它不需要重新训练模型,或许是降低推理成本的更务实方案。
阅读全文一项研究将大语言模型的输出投影与 Top-k 选择重写为最大内积搜索,并以 HNSW 向量索引替代完整词表矩阵。CPU 实验显示,该方法在小批量、低延迟场景尤其有潜力。
阅读全文一项针对长上下文和工具调用的实验显示,即使权重、显卡和提示词相同,注意力后端、KV缓存精度、量化方案及多卡通信仍可能改变模型的下一枚Token。
阅读全文TileMix 将注意力矩阵划分为硬件友好的分数瓦片,并在同一个融合内核中为不同瓦片选择 FP16 或 INT8。它不裁剪 token 连接,在提升预填充效率的同时,试图弥补统一 INT8 带来的长上下文质量损失。
阅读全文结构化压缩叠加4比特量化,往往会损伤大模型的推理、数学、编程和长上下文能力。Multiverse Computing提出量化感知修复方法QAH,让量化学生模型直接向原始未压缩模型学习。
阅读全文Multiverse Computing 提出 Quantization-Aware Healing(QAH),让经过结构压缩和 4-bit 量化的模型直接向原始大模型学习。在 GPT-OSS 120B 压缩至 60B 的实验中,QAH 模型在 9 项基准中的 7 项超过同架构 BF16 模型。
阅读全文Daedalus-150M 没有把大模型架构缩小后再适配 CPU,而是先锁定单用户、单 token、4-bit 权重等部署条件,再决定网络结构。它用短卷积替代三分之二的全注意力模块,在长上下文下实现更稳定的缓存开销和更高解码速度。
阅读全文ParaTempo 提出一种无需训练的异步并行推理框架,通过观察各推理分支在多个时刻对答案空间的收敛程度,动态决定剪枝、提前退出和重新分叉。它试图在保持并行推理鲁棒性的同时,减少无效计算。
阅读全文Nexus 针对 MCP 智能体每轮重复编码工具 schema、导致首 token 延迟上升的问题,提出检索式工具路由与受控 KV-cache 拼接两条路径。实验显示,检索路径在工具规模扩大时更稳定,而 KV 拼接的收益受 RoPE 位置漂移限制。
阅读全文Llama-Mobile提出一套面向移动部署的视觉语言模型量化方案,结合模型自生成数据与适配Arm CPU的2.7比特格式,将Llama 3.2 11B Vision Instruct压缩至3.7 GB。实验显示,在8比特激活下,模型在多项标准视觉问答任务中仍保持较强表现。
阅读全文vLLM 发布实践指南,介绍如何在 AMD Instinct MI300X、MI355X 与 ROCm 环境中使用推测解码。文章对比原生 MTP、EAGLE-3、DFlash、DSpark 等方案,并强调接受率与工作负载对收益的决定性影响。
阅读全文