打开黑箱:研究者如何提取前沿模型的隐藏思维链
导语
前沿语言模型的能力提升,通常被归因于更强的推理能力。但对于闭源模型,外界看不到原始思维链,只能从最终答案和基准成绩推测模型究竟做了什么。论文《Capable yet Parsimonious》提出了一种相对简单的观察方法:通过标准 API 支持的自定义工具调用,诱导模型把部分中间推理外显出来。
研究对象包括开源模型,以及 GPT-6 Astra、GPT-5.6 Sol、Claude Opus 4.8 和 Claude Sonnet 5 等闭源前沿模型。作者没有直接假定外显内容就是真实思维,而是先在开源模型上将提取结果与原生思维链进行对照,再把方法扩展到闭源系统。这一步很关键,因为模型完全可能生成一段看似合理的解释,为已经得到的答案进行事后辩护。
核心要点
- 外显推理具备一定有效性。 在竞赛数学、科学问答和代码生成任务中,提取出的推理表现与原生思维链相符,并明显超过不启用推理的基线。
- 不同模型的“思考风格”并不相同。 研究从 token 使用效率、推理步骤类型和诱导出的推理树等角度进行分析,观察模型如何展开、压缩和组织中间过程。
- Astra更偏向定向推理。 它更早选择正确路径,回溯和试错较少;简单计算等基础环节往往留在内部,只把关键步骤外显出来。
- 短轨迹不是绝对的能力证明。 高效推理、训练数据记忆和事后合理化,都可能在外部呈现为“很快得出正确答案”。
意义与影响
这项工作把评估重点从“模型答对了多少”推进到“模型如何组织可观察的推理”。如果工具调用确实能稳定捕捉部分中间行为,研究者就有机会分析模型何时走错路线、何时回溯,以及不同模型如何在准确性与 token 成本之间取舍。这对推理效率评估、模型监控和安全审计都有价值。
不过,外显文本仍然是模型生成的行为产物,不等同于完整、忠实的内部计算记录。未来需要结合更多任务、对抗性测试和独立验证,判断这些轨迹能否持续揭示错误来源,而不是只提供一份看起来可信的解释。论文透露,相关方法已向 OpenAI 和 Anthropic 进行披露。
评论
正在确认登录状态……
正在加载评论……