返回文章列表
推理与部署

HybridInfer:让手机大模型路由感知温度,而不只是算力

阅读约 3 分钟

导语

端侧大模型的吸引力很明确:数据留在手机上,可以离线运行,也不产生逐次调用费用。但在真实移动硬件上,端侧推理的瓶颈并不总是速度。HybridInfer的研究发现,在一款搭载骁龙8 Elite的旗舰手机上,连续进行端侧生成可能使GPU推理运行时崩溃,或在没有明显提示的情况下卡死。

这意味着,面向端—边—云的模型路由不能只看请求难度、延迟和价格,还需要知道手机当前还剩多少“热余量”。

核心方法:把温度纳入路由状态

HybridInfer构建了三级推理架构:端侧使用Llama 3.2 3B,边缘侧使用带检索能力的Llama 3.1 8B,云端则使用GPT-4o。路由器以手机热余量和查询复杂度估计作为状态,通过离线训练的Q-learning策略决定每次请求交给哪一层处理。

其奖励函数同时考虑回答质量、延迟、调用成本和热风险,并额外加入“本地性奖励”,鼓励在端侧能够胜任时优先保留数据与计算。作者特别指出,如果没有这项奖励,最优策略会倾向于把所有请求都卸载出去:这虽然规避了设备压力,却失去了端侧推理的隐私、离线和成本优势。

真实设备结果

研究在三星Galaxy S25+上运行了包含210条提示词的安卓基准测试,并与两种手工调参的启发式方法比较。HybridInfer取得了显著更高的整体质量,统计检验的配对Wilcoxon结果为p<0.02,同时在自适应条件下实现最低成本。

不过,实验并没有宣称端侧模型在回答质量上全面胜出。只要请求能够被端侧模型处理,始终使用端侧的方案在单次质量上可以相当;代价是速度慢三到六倍,而且面对较长请求时可能失败。动态路由的优势主要体现在延迟、可靠性和覆盖范围,而不是让小模型本身变得更强。

意义与局限

这项工作把移动端推理中的“热管理”从系统监控问题提升为模型服务决策问题。它提示开发者:设备状态、运行时稳定性和隐私偏好,可能需要与模型能力一起进入统一的路由策略。

同时,现有结论仍来自单款手机、210条提示词和特定的三层模型组合,不能直接代表所有芯片、温控策略或应用负载。论文的安卓测量工具和完整路由评测流程已公开,这为在更多设备上复现实验、检验策略泛化能力提供了基础。

如果端侧AI要从演示走向长时间使用,未来的关键或许不是“默认把请求放在手机上”,而是让系统知道何时应该坚持本地、何时应该暂时借助边缘或云端。

arXiv

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Mentored Decoding:推测解码如何兼顾更快推理与更高质量
推理与部署
cctest.ai
推理与部署

Mentored Decoding:推测解码如何兼顾更快推理与更高质量

一篇 arXiv 论文将有损推测解码与机器学习中的 boosting 理论联系起来,解释了为什么放宽与目标模型的一致性后,生成结果有时反而可能在质量上超过目标模型。研究还给出了适用于多类散度的优化方法与数据结构。

阅读全文
CCTest · Blog
RAZOR:用“可替代性”判断 MoE 专家是否值得保留
推理与部署
cctest.ai
推理与部署

RAZOR:用“可替代性”判断 MoE 专家是否值得保留

RAZOR 提出一种无需训练的 MoE 专家剪枝方法,不再单纯依据专家使用频率或输出幅度决定删留,而是评估其他专家能否接替被剪除专家的功能。实验显示,该方法在多个模型和剪枝比例下优于对比方法,但生成稳定性仍可能受到影响。

阅读全文