返回文章列表
模型评测

医疗开放式事实核查,为什么检索增强评测会失灵?

阅读约 3 分钟

导语

在医疗场景中,检索增强生成常被寄予厚望:模型先从医学文献或权威资料中找到证据,再判断一段回答是否真实。相比直接让大模型“凭记忆”评估,这种检索—验证范式看似更透明,也更容易规模化。然而,一项聚焦长篇医疗答案事实性的研究指出,系统在基准测试中取得不错分数,并不意味着它真的找到了正确证据,或做出了可靠判断。

核心发现

研究以开放式的MedExpert数据集为重点,并结合3个封闭式数据集,考察了4种检索方法、6个验证模型和3类语料来源。结果呈现出明显的开放式落差:在封闭式生物医学基准上,F1可达到0.78;到了由临床专家标注的开放式医疗答案场景,最佳配置——Qwen3检索器搭配GPT-5.4验证器——F1仅为0.06。

问题首先出在“检索到”不等于“找到证据”。不同检索器返回的段落中,只有18.5%至42%能够直接支持或反驳目标声明。其余内容可能只是主题相关,却讨论了不同人群、不同临床条件,或者来自证据等级较低的来源。若把这类材料一律交给验证模型,后续判断就已经埋下风险。

研究还把验证阶段拆成六个连续环节:选择证据、理解证据、进行临床推断、将结论与证据对应、校准置信度,以及保持标签一致性。模型可能在任一环节出错。例如,它看到了相关段落,却忽略了适用人群差异;也可能把合理的医学常识当成文献明确支持的结论,最终给出过高置信度。

为什么扩大模型仍不够

研究者用LLM辅助模式归纳,并结合人工与临床专家核验,对800组声明—证据样本和576条推理轨迹进行分析。测试结果显示,增加推理投入会消耗更多令牌,却没有带来相应的召回率改善;更大的模型、医学领域微调以及更广泛的权威网页语料,也没有消除主要失败模式。

这意味着,问题未必只是模型能力不足,而可能是“先检索、后验证”的流程本身难以处理开放式医疗回答。开放式答案通常包含多个细粒度声明,每个声明的适用条件、证据等级和临床语境都不同。单一F1分数无法说明系统究竟是没找到证据、误读证据,还是在推理后过度自信。

意义与影响

这项工作为医疗RAG和自动事实核查系统提供了一份诊断框架:评测时不应只报告准确率、召回率或F1,还要分别检查证据是否真正相关、是否覆盖正确人群、来源是否可靠,以及验证器在推理链的哪个环节失效。对高风险医疗应用而言,能够解释“错在哪里”,往往比得到一个看似漂亮的总分更重要。

研究也提醒开发者,增加模型规模或上下文长度不是解决事实核查问题的万能办法。未来系统可能需要更细粒度的声明分解、面向临床条件的证据匹配,以及对不确定性的显式管理,而不能把检索结果的存在简单等同于事实依据。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章