CARDEA:让冠脉造影 AI 的推理过程可追溯
冠状动脉造影(CAG)仍是诊断冠状动脉疾病的重要依据,但影像判读会受到观察者经验影响。现有 AI 往往能够给出分类结果,却很少说明自己关注了哪些血管区域、如何形成判断。这种“只报答案”的方式,在临床环境中不容易核查,也限制了医生对模型的信任。
CARDEA 试图把可审计性放到模型设计的中心。它是一个面向 CAG 的统一大型视觉语言模型,输出最终判断前,会在推理轨迹中结合多个影像区域。研究团队将这一机制称为 Chain-of-Box(CoB):模型不仅生成文字层面的推理,还被鼓励用边界框指出与判断相关的解剖或病变位置。需要注意的是,影像标注可以帮助人检查模型依据,但并不自动等同于临床意义上的正确解释。
核心要点
- 三阶段训练。 第一阶段进行视觉特征对齐,使模型更好地处理冠脉造影特征;第二阶段通过自蒸馏自动构造带 CoB 的推理数据,完成冷启动;第三阶段采用带可验证奖励的强化学习(RLVR),同时奖励任务正确性和边界框使用。
- 训练数据保持开放取向。 模型仅使用公开数据集和闭集任务训练,报告生成没有被纳入训练目标,因此可以观察模型是否具备跨任务迁移能力。
- 评估覆盖多个层面。 研究比较了冠脉优势类型和复杂度评估,也在外部队列上零样本测试报告生成,并以血管严重程度的宏平均 F1 作为指标。
- 强化学习带来关键变化。 在优势类型的分布内测试中,CARDEA 落后于专用分类器;发生域偏移后,两者差距缩小,模型准确率为 0.91,置信区间为 0.86 至 0.95。在复杂度评估上,模型准确率为 0.90,置信区间为 0.82 至 0.97,与两名介入心脏病学专家表现相当。报告生成方面,只有 RLVR 阶段带来明显改善:外部队列上的血管严重程度宏平均 F1 达到 0.686,基础模型为 0.513。
这项工作的意义不只是把语言模型用于医学影像,而是尝试将“证据定位”纳入训练反馈。若模型的文字结论与边界框能够相互对应,医生便有机会更快发现它是否看错血管、忽略关键区域,或是在视觉证据不足时给出过度推断。与此同时,结果也说明可审计推理不能简单理解为增加一段解释文字:真正有效的改进来自对视觉依据和任务结果同时施加约束。
不过,当前证据仍主要来自研究评测,而不是临床工作流中的前瞻性验证。模型在分布内任务上并非全面优于专用系统,报告生成结果也不能直接代表真实诊疗安全性。边界框是否准确覆盖病变、推理轨迹是否稳定,以及不同设备、造影角度和患者群体下的表现,都还需要更严格的外部验证。CARDEA 公开模型权重和推理代码,为后续复现、审计和临床适配提供了基础,但距离独立承担诊断责任仍有明显距离。
评论
正在确认登录状态……
正在加载评论……