临床计算器不该交给大模型心算:程序求解方案的真实收益
导语
临床风险评分、剂量估算和分层工具往往包含多步运算。对语言模型而言,算术错误可能只是一个小数点或加减法失误;对临床决策而言,却可能改变最终建议。面对这一问题,常见路径是为每个计算器分别编写并验证专用函数。新研究测试了另一种更通用的设计:模型不直接“心算”,而是根据病例生成一段针对性的 Python 代码,再交给受限的本地执行器完成确定性计算。
核心要点
- 任务被拆成理解与执行。 模型主要负责判断应使用哪条公式、如何填入变量以及是否需要调用求解器;具体算术交给执行环境完成。
- 实验并非只比较工具有无。 研究使用 MedCalc-Bench Verified 的1100个案例和55个临床计算器,测试 Qwen2.5-7B 与 Qwen2.5-32B-AWQ,并让直接计算路线和程序路线获得相同的公式、变量信息及完整病历文本。
- 7B 模型的提升不够稳定。 程序求解准确率为75.31%,直接计算为72.02%,配对差异为3.29个百分点;按计算器聚类计算的95%区间为[-3.49, 10.38],因此不能据此认定存在稳定优势。
- 更大的模型获得了更清晰的收益。 在32B模型上,程序求解达到90.53%,直接计算为83.47%,提升7.05个百分点,区间为[0.47, 14.60],已经排除零点。
- 手写库的覆盖率与精度存在取舍。 22个计算器组成的手写库在其支持的440个案例上完全正确,但未覆盖的案例会弃答,整体准确率为40.0%。
- 公式本身仍是风险源。 研究者审查了基准公式,并指出55个计算器中有16个存在版本、使用方式或系数方面的疑点。
这项结果意味着什么
这项工作更准确的结论不是“加上 Python 就能让临床模型可靠”,而是:确定性执行可以减少一类错误,但它只覆盖计算链条的最后一段。模型仍需从病历中识别年龄、体重、实验室指标等变量,选择正确工具,并理解公式适用条件。如果变量抽取错了,或者公式已经过时,执行器只会把错误稳定地算出来。
研究还提醒人们,工具收益不能脱离模型能力讨论。7B模型在相同信息条件下并未表现出稳健增益,32B模型则更能把程序求解接口转化为实际优势。这可能反映出工具调用、代码生成和任务分解能力对模型规模较为敏感,但素材并未证明规模是唯一原因。
在工程实践中,更可取的方向是组合式防护:对公式和版本进行临床审核,用受限执行环境替代自由计算,同时对变量来源、单位、缺失值和适用范围设置校验,并允许系统在无法确认时弃答。对于医疗场景,准确的算术只是必要条件,不是充分条件。
评论
正在确认登录状态……
正在加载评论……