返回文章列表
模型评测

临床计算器不该交给大模型心算:程序求解方案的真实收益

阅读约 3 分钟

导语

临床风险评分、剂量估算和分层工具往往包含多步运算。对语言模型而言,算术错误可能只是一个小数点或加减法失误;对临床决策而言,却可能改变最终建议。面对这一问题,常见路径是为每个计算器分别编写并验证专用函数。新研究测试了另一种更通用的设计:模型不直接“心算”,而是根据病例生成一段针对性的 Python 代码,再交给受限的本地执行器完成确定性计算。

核心要点

  • 任务被拆成理解与执行。 模型主要负责判断应使用哪条公式、如何填入变量以及是否需要调用求解器;具体算术交给执行环境完成。
  • 实验并非只比较工具有无。 研究使用 MedCalc-Bench Verified 的1100个案例和55个临床计算器,测试 Qwen2.5-7B 与 Qwen2.5-32B-AWQ,并让直接计算路线和程序路线获得相同的公式、变量信息及完整病历文本。
  • 7B 模型的提升不够稳定。 程序求解准确率为75.31%,直接计算为72.02%,配对差异为3.29个百分点;按计算器聚类计算的95%区间为[-3.49, 10.38],因此不能据此认定存在稳定优势。
  • 更大的模型获得了更清晰的收益。 在32B模型上,程序求解达到90.53%,直接计算为83.47%,提升7.05个百分点,区间为[0.47, 14.60],已经排除零点。
  • 手写库的覆盖率与精度存在取舍。 22个计算器组成的手写库在其支持的440个案例上完全正确,但未覆盖的案例会弃答,整体准确率为40.0%。
  • 公式本身仍是风险源。 研究者审查了基准公式,并指出55个计算器中有16个存在版本、使用方式或系数方面的疑点。

这项结果意味着什么

这项工作更准确的结论不是“加上 Python 就能让临床模型可靠”,而是:确定性执行可以减少一类错误,但它只覆盖计算链条的最后一段。模型仍需从病历中识别年龄、体重、实验室指标等变量,选择正确工具,并理解公式适用条件。如果变量抽取错了,或者公式已经过时,执行器只会把错误稳定地算出来。

研究还提醒人们,工具收益不能脱离模型能力讨论。7B模型在相同信息条件下并未表现出稳健增益,32B模型则更能把程序求解接口转化为实际优势。这可能反映出工具调用、代码生成和任务分解能力对模型规模较为敏感,但素材并未证明规模是唯一原因。

在工程实践中,更可取的方向是组合式防护:对公式和版本进行临床审核,用受限执行环境替代自由计算,同时对变量来源、单位、缺失值和适用范围设置校验,并允许系统在无法确认时弃答。对于医疗场景,准确的算术只是必要条件,不是充分条件。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Benchmark Radar:把 AI 基准测试检索变成一项可追溯的基础设施
模型评测
cctest.ai
模型评测

Benchmark Radar:把 AI 基准测试检索变成一项可追溯的基础设施

Benchmark Radar 是一个持续更新的 AI 基准测试数据库与搜索引擎,聚合论文、代码仓库、数据集、模型卡和技术报告中的评测证据。它试图帮助研究者更快找到相关基准,并在比较分数时看到实验设置、来源和使用趋势。

阅读全文
CCTest · Blog
LLM裁判也会偏心:能力越强的模型,越容易拿到宽松评分
模型评测
cctest.ai
模型评测

LLM裁判也会偏心:能力越强的模型,越容易拿到宽松评分

一项覆盖四个基准、六个模型的研究显示,LLM作为自动评审员时,评审能力与自身任务能力高度相关,但也会对更强的被评模型系统性放宽标准。研究提出无需真实标签的加权多裁判校准方法,以降低这种偏差。

阅读全文