返回文章列表
推理与部署

ParaTempo:用时间置信度让并行推理动态“分流”

阅读约 3 分钟

大型推理模型往往不只生成一条思路,而是同时探索多条可能的解题路径。这样的并行推理类似于扩大搜索范围:某条路径走偏时,其他分支仍有机会找到正确答案。不过,分支越多、思考越深,推理成本和延迟也越高。如何判断哪些分支值得继续,成为并行推理能否真正落地的关键。

ParaTempo 的核心思路,是把“时间上的答案收敛”作为分支级控制信号。它不要求模型完成整条推理链后再比较最终答案,也不只依赖某一步生成 token 时的局部概率。系统会在推理过程中周期性地对每个分支进行轻量探测,获得一个临时的答案概率分布,再观察这些分布在最近多个时刻是否逐渐集中到某个候选答案上。若一个分支长期指向同一答案,其 temporal confidence(时间置信度)就会提高;如果答案分布持续分散或频繁变化,说明该分支尚未形成稳定判断。

围绕这一信号,ParaTempo 设计了异步的资源调度机制:

  • 对低置信度、缺乏收敛迹象的分支进行剪枝,避免继续消耗计算资源;
  • 对持续承诺某个主导答案的分支提前“退休”,不必等待所有推理步骤完成;
  • 将被释放的预算重新分配,通过分叉创建新的推理路径;
  • 当多个分支的置信度加权投票足够集中时,提前结束全局生成。

这一流程的一个重要特点是无需让所有推理轨迹在同一时刻同步。不同分支可以按照各自的收敛速度继续、暂停、退出或重新扩展,因此计算资源能够更贴近实际的不确定性分布。与固定分支数、固定推理长度的方案相比,这种机制更像一个面向推理过程的动态调度器。

从方法定位看,ParaTempo 属于 training-free 框架,不需要额外训练模型来学习退出或剪枝策略。它将控制逻辑集中在一个相对统一的信号上,也避免把最终答案共识、局部 token 置信度和中间探针分别作为彼此割裂的决策依据。论文在数学和科学推理基准上评估了该方法,并报告其能够降低平均推理延迟;但给定材料未提供具体数值,因此不宜据此判断其相对不同基线的收益幅度。

ParaTempo 的意义在于,它把并行推理从“多生成几份答案再投票”推进到“根据过程状态实时管理搜索”。这对于推理服务尤其重要:简单问题可以较早收敛,困难问题则可获得更多分支预算。不过,时间置信度仍然是模型内部信号的间接指标。若多个分支共同陷入相同错误,答案空间的集中并不必然代表正确;探测本身也会带来额外开销。未来,如何校准这种置信度、识别相关性很高的错误分支,并在不同任务上设置可靠的停止条件,将决定这类动态并行推理策略的实际价值。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Daedalus-150M:为普通 CPU 推理反向设计的卷积—注意力混合模型
推理与部署
cctest.ai
推理与部署

Daedalus-150M:为普通 CPU 推理反向设计的卷积—注意力混合模型

Daedalus-150M 没有把大模型架构缩小后再适配 CPU,而是先锁定单用户、单 token、4-bit 权重等部署条件,再决定网络结构。它用短卷积替代三分之二的全注意力模块,在长上下文下实现更稳定的缓存开销和更高解码速度。

阅读全文
CCTest · Blog
Llama-Mobile:用2.7比特量化把视觉语言模型带到移动端
推理与部署
cctest.ai
推理与部署

Llama-Mobile:用2.7比特量化把视觉语言模型带到移动端

Llama-Mobile提出一套面向移动部署的视觉语言模型量化方案,结合模型自生成数据与适配Arm CPU的2.7比特格式,将Llama 3.2 11B Vision Instruct压缩至3.7 GB。实验显示,在8比特激活下,模型在多项标准视觉问答任务中仍保持较强表现。

阅读全文