返回文章列表
推理与部署

小模型不该只会继续思考:FlyBy让推理系统学会何时求助

阅读约 3 分钟

导语

在推理模型中,增加测试时计算通常意味着让模型“想得更久”。这种方法对参数规模较小、服务成本较低的模型尤其有吸引力:如果更多思考可以换来更高准确率,就不必直接部署更大的模型。但KAIST AI团队的新研究提出了一个关键问题:模型当前缺的究竟是时间,还是知识?

论文通过对多个模型家族和不同规模模型的中间推理状态进行干预,考察自我反思到底带来了什么。研究结论并不是简单否定长思考,而是指出,反思往往主要把概率集中到当前状态已经能够到达的答案上,并不一定创造新的可行解题路径。

两类不同的瓶颈

研究将小型推理模型的失败划分为两种情形:

  • 执行瓶颈:正确路径已经在模型的能力范围内,但模型在推导、检查或选择步骤时出错。此时,继续反思和自我修正有机会恢复正确答案。
  • 知识瓶颈:模型缺少完成任务所需的事实、概念或背景信息。即使继续生成更多思考,也很难凭空获得原本不存在于其参数知识中的内容;外部信息则可能让正确路径变得可达。

这个区分改变了推理系统的基本策略。面对执行错误,系统应投入更多内部计算;面对知识缺口,继续思考可能只是重复已有的猜测,查询更强模型或其他外部来源反而更有效。

FlyBy如何工作

基于上述观察,论文提出选择性查询框架FlyBy。它要求模型先进行自身推理,再诊断问题尚未解决的原因。当系统判断自己遭遇知识瓶颈时,才向参数知识更丰富的外部强模型发起查询,并将返回的信息整合进后续推理,而不是对每个问题都进行无差别调用。

FlyBy的训练分为两个阶段。监督微调先建立多深度查询动作,使模型能够学习不同程度的外部求助方式;随后,成本感知强化学习进一步校准三个决策:是否查询、应该询问什么,以及愿意为查询付出多少计算成本。由此,外部模型不再只是固定的“答案供应商”,而成为由小模型按需调用的能力扩展层。

实验结果与意义

在六个基准、共1158道高难度题目上,FlyBy-4B的pass@8达到45.96%,高于Qwen3-14B的41.64%,同时服务成本低至后者的约2.7分之一。单次尝试的pass@1为16.85%,也超过Qwen3-8B的15.31%。将规模提升到8B后,FlyBy的pass@8进一步达到51.81%。这些结果说明,模型规模、推理时长和外部查询之间并非只能三选一;更合理的路线上,小模型可以承担大部分基础推理,只在真正需要时借用更强模型的知识。

当然,选择性查询并不意味着所有任务都适合调用外部模型。查询判断本身会带来额外开销,返回信息也需要被正确理解和整合。因此,FlyBy的价值更接近一种推理编排思路:先识别失败类型,再匹配计算或知识资源。

对实际部署而言,这一思路尤其适用于成本敏感的服务。未来的推理优化可能不只是让模型生成更长的思维链,还包括让模型知道何时继续想、何时检查、何时提问,以及何时停止。小模型的竞争力,也可能来自更聪明地管理有限的内部能力与外部能力。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
让 Prefill 与 Decode 各用一套量化方案:DQ 如何兼顾速度与精度
推理与部署
cctest.ai
推理与部署

让 Prefill 与 Decode 各用一套量化方案:DQ 如何兼顾速度与精度

一项名为 Disaggregated Quantization 的方法,针对 LLM 推理中的 Prefill 和 Decode 阶段分别设计计算格式、权重与存储策略。在 Qwen 3、Gemma 3 等模型上的实验显示,它有望同时改善低比特推理精度与首 token 延迟。

阅读全文
CCTest · Blog
RAZOR:用“可替代性”判断 MoE 专家是否值得保留
推理与部署
cctest.ai
推理与部署

RAZOR:用“可替代性”判断 MoE 专家是否值得保留

RAZOR 提出一种无需训练的 MoE 专家剪枝方法,不再单纯依据专家使用频率或输出幅度决定删留,而是评估其他专家能否接替被剪除专家的功能。实验显示,该方法在多个模型和剪枝比例下优于对比方法,但生成稳定性仍可能受到影响。

阅读全文