返回文章列表
模型评测

U-Space:让语言模型的不确定性变得可读、可追踪

阅读约 3 分钟

导语

语言模型的问题不只是“会不会答错”,还在于它们往往能用流畅、笃定的语气包装错误结论。在医疗、科研、决策支持等高风险场景中,系统能否识别“这次回答不太可靠”,与答案本身同样重要。现有不确定性量化方法通常依赖多次生成、额外训练的组件,或者只给出一个难以解释的分数,也很难说明不确定性究竟在推理的哪个阶段出现。

一篇发表于 Hugging Face Daily Papers 的研究提出了 U-Space,试图从语言模型的中间状态中读取这种信号。

核心方法:把“怀疑”映射到模型空间

研究者首先选取能够表达确定与怀疑的语义锚点,再将这些词对应的反嵌入方向映射回模型残差空间,并组合成一个正交的低维基。模型生成每个 token 时,U-Lens会把对应的隐藏状态投影到这些方向上,从而获得随生成过程变化的可解释读数。

论文重点区分了四类不确定性:

  • 歧义:问题或表述存在多种合理解释;
  • 信息不完整:已有内容不足以支撑确定结论;
  • 证据冲突:不同线索指向相互矛盾的答案;
  • 一般不确定性:模型整体表现出的缺乏把握。

U-Lens并不只依靠这些语义信号,而是将其与预测熵这一分布层面的指标结合。这样既保留了模型输出分布中的不确定性,也能提供更接近人类语言的解释,而且只需要一次生成,不依赖正确性标签或特定任务训练。

实验观察

研究覆盖三种推理模型和四个基准任务,涉及知识问答、数学推理及综合能力评估。作者报告称,U-Lens在答案可靠性预测方面表现领先。一个重要发现是,回答长度本身确实是很强的预测因素:不加控制时,长度与正确性和不确定性分数都存在明显关联。但在控制长度后,多数基线性能下降,U-Lens的性能下降幅度较小,仍保持较强表现。这说明它捕捉到的并不只是“模型回答得长不长”。

逐 token 的读数还可以显示不确定性在什么时候出现,以及它属于哪一种类型。进一步的干预实验表明,沿着识别出的方向进行操控,能够让模型即使面对简单问题也表现得更加犹豫,提示这些方向不只是事后相关指标,也与模型行为有关。

意义与边界

U-Space的价值在于,它把“不确定性估计”从一个黑箱分数推进到过程级观察:开发者可以看到模型是在理解问题时产生歧义,还是在整合证据时遭遇冲突。这为自动拒答、人工复核和风险分级提供了更细粒度的信号,也降低了将不确定性模块接入现有推理流程的成本。

不过,论文材料主要展示了方法在指定模型和基准上的结果,不能据此断言它已经适用于所有模型或真实业务场景。将内部语义方向稳定地迁移到不同架构、语言和任务,仍需要进一步验证。研究还初步探索了把同类的无标签构造扩展到情绪和奖励劫持检测,但这些方向目前更适合作为后续研究线索,而非成熟能力。

总体而言,U-Space提供了一条有吸引力的路线:不仅判断模型是否不确定,还尝试解释不确定性从何而来、如何随生成演化,以及能否被干预。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章