返回文章列表
模型评测

打开黑箱:研究者如何提取前沿模型的隐藏思维链

阅读约 2 分钟

导语

前沿语言模型的能力提升,通常被归因于更强的推理能力。但对于闭源模型,外界看不到原始思维链,只能从最终答案和基准成绩推测模型究竟做了什么。论文《Capable yet Parsimonious》提出了一种相对简单的观察方法:通过标准 API 支持的自定义工具调用,诱导模型把部分中间推理外显出来。

研究对象包括开源模型,以及 GPT-6 Astra、GPT-5.6 Sol、Claude Opus 4.8 和 Claude Sonnet 5 等闭源前沿模型。作者没有直接假定外显内容就是真实思维,而是先在开源模型上将提取结果与原生思维链进行对照,再把方法扩展到闭源系统。这一步很关键,因为模型完全可能生成一段看似合理的解释,为已经得到的答案进行事后辩护。

核心要点

  • 外显推理具备一定有效性。 在竞赛数学、科学问答和代码生成任务中,提取出的推理表现与原生思维链相符,并明显超过不启用推理的基线。
  • 不同模型的“思考风格”并不相同。 研究从 token 使用效率、推理步骤类型和诱导出的推理树等角度进行分析,观察模型如何展开、压缩和组织中间过程。
  • Astra更偏向定向推理。 它更早选择正确路径,回溯和试错较少;简单计算等基础环节往往留在内部,只把关键步骤外显出来。
  • 短轨迹不是绝对的能力证明。 高效推理、训练数据记忆和事后合理化,都可能在外部呈现为“很快得出正确答案”。

意义与影响

这项工作把评估重点从“模型答对了多少”推进到“模型如何组织可观察的推理”。如果工具调用确实能稳定捕捉部分中间行为,研究者就有机会分析模型何时走错路线、何时回溯,以及不同模型如何在准确性与 token 成本之间取舍。这对推理效率评估、模型监控和安全审计都有价值。

不过,外显文本仍然是模型生成的行为产物,不等同于完整、忠实的内部计算记录。未来需要结合更多任务、对抗性测试和独立验证,判断这些轨迹能否持续揭示错误来源,而不是只提供一份看起来可信的解释。论文透露,相关方法已向 OpenAI 和 Anthropic 进行披露。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
ExplorationBench:让AI在“外星世界”中接受探索能力考验
模型评测
cctest.ai
模型评测

ExplorationBench:让AI在“外星世界”中接受探索能力考验

ExplorationBench试图解决一个长期难题:如何判断AI是真的通过实验发现新规律,而不是从训练数据中回忆答案。研究者构建了两个规则可执行、又有意违背常识的虚拟环境,用可验证任务评估模型的探索过程与结果。

阅读全文
CCTest · Blog
WhatWorkedBench:用有限实验检验 AI 研究代理是否真正理解“什么有效”
模型评测
cctest.ai
模型评测

WhatWorkedBench:用有限实验检验 AI 研究代理是否真正理解“什么有效”

WhatWorkedBench 为 AI 研究代理设计了一套实验理解基准:代理需要在有限预算下选择测量、分析代码,并预测不同组件组合的结果。研究显示,高斯过程、成对效应建模和代码等价性信息都能显著提升预测效果。

阅读全文