小模型不该只会继续思考:FlyBy让推理系统学会何时求助
导语
在推理模型中,增加测试时计算通常意味着让模型“想得更久”。这种方法对参数规模较小、服务成本较低的模型尤其有吸引力:如果更多思考可以换来更高准确率,就不必直接部署更大的模型。但KAIST AI团队的新研究提出了一个关键问题:模型当前缺的究竟是时间,还是知识?
论文通过对多个模型家族和不同规模模型的中间推理状态进行干预,考察自我反思到底带来了什么。研究结论并不是简单否定长思考,而是指出,反思往往主要把概率集中到当前状态已经能够到达的答案上,并不一定创造新的可行解题路径。
两类不同的瓶颈
研究将小型推理模型的失败划分为两种情形:
- 执行瓶颈:正确路径已经在模型的能力范围内,但模型在推导、检查或选择步骤时出错。此时,继续反思和自我修正有机会恢复正确答案。
- 知识瓶颈:模型缺少完成任务所需的事实、概念或背景信息。即使继续生成更多思考,也很难凭空获得原本不存在于其参数知识中的内容;外部信息则可能让正确路径变得可达。
这个区分改变了推理系统的基本策略。面对执行错误,系统应投入更多内部计算;面对知识缺口,继续思考可能只是重复已有的猜测,查询更强模型或其他外部来源反而更有效。
FlyBy如何工作
基于上述观察,论文提出选择性查询框架FlyBy。它要求模型先进行自身推理,再诊断问题尚未解决的原因。当系统判断自己遭遇知识瓶颈时,才向参数知识更丰富的外部强模型发起查询,并将返回的信息整合进后续推理,而不是对每个问题都进行无差别调用。
FlyBy的训练分为两个阶段。监督微调先建立多深度查询动作,使模型能够学习不同程度的外部求助方式;随后,成本感知强化学习进一步校准三个决策:是否查询、应该询问什么,以及愿意为查询付出多少计算成本。由此,外部模型不再只是固定的“答案供应商”,而成为由小模型按需调用的能力扩展层。
实验结果与意义
在六个基准、共1158道高难度题目上,FlyBy-4B的pass@8达到45.96%,高于Qwen3-14B的41.64%,同时服务成本低至后者的约2.7分之一。单次尝试的pass@1为16.85%,也超过Qwen3-8B的15.31%。将规模提升到8B后,FlyBy的pass@8进一步达到51.81%。这些结果说明,模型规模、推理时长和外部查询之间并非只能三选一;更合理的路线上,小模型可以承担大部分基础推理,只在真正需要时借用更强模型的知识。
当然,选择性查询并不意味着所有任务都适合调用外部模型。查询判断本身会带来额外开销,返回信息也需要被正确理解和整合。因此,FlyBy的价值更接近一种推理编排思路:先识别失败类型,再匹配计算或知识资源。
对实际部署而言,这一思路尤其适用于成本敏感的服务。未来的推理优化可能不只是让模型生成更长的思维链,还包括让模型知道何时继续想、何时检查、何时提问,以及何时停止。小模型的竞争力,也可能来自更聪明地管理有限的内部能力与外部能力。
评论
正在确认登录状态……
正在加载评论……