OpenTumorBoard:让大模型接受真实肿瘤多学科讨论考验
导语
肿瘤多学科会诊并不是一次简单的问答。影像、病理、既往治疗、患者病史和手术条件,往往需要由不同专业的医生连续讨论,逐步收敛到治疗方案、手术计划和下一步检查。OpenTumorBoard试图把这种“讨论过程”本身纳入大模型评测,而不只考察模型能否给出一个孤立的诊断答案。
基准覆盖了什么
研究团队从YouTube上公开发布的219场肿瘤委员会会议中转录素材,整理出611个患者病例、19,157轮讨论,以及来自十类专科角色的发言。素材总时长为12,534分钟,会议中还包含16,215个面向专家的问题。数据集及其自动化整理流程计划开放,另有配套排行榜和代码可供研究者使用。
评测分为两种模式:
- SPECIALIST TURN:给模型一个真实会议中提出的、具有临床意义的问题,要求它以相应专家的身份作答。
- BOARD SIMULATION:提供病例摘要和演示文稿,让模型模拟完整的多轮委员会讨论,并最终形成治疗推荐、手术计划、后续行动或临床试验匹配结论。
结果说明了什么
研究对14个通用前沿模型和医疗模型进行了评测。表现最好的模型,在与专家回答的临床等效性上得分为3.43/5;在复现真实委员会最终结论方面,得分为2.78/5。两个分数都说明,模型或许能够覆盖部分医学信息,却未必能稳定理解不同专业意见如何相互补充、冲突并最终形成共识。
这一差距也揭示了传统医疗问答基准的局限:单轮答案正确,不等于能在长程病史、跨模态证据和多角色协作中做出一致决策。研究还显示,在留出测试集上进行监督微调和强化学习后,模型表现有所改善,表明真实讨论轨迹不仅适合做排行榜,也可能成为训练医疗协作模型的资源。
意义与边界
三名医学博士对部分数据进行审阅,认为病例信息覆盖度和事实性较高,抽取出的委员会共识也具有较强忠实度。这为数据集的可用性提供了初步支持。不过,公开会议素材并不能自动代表所有医疗机构和临床流程;转录、病例摘要和共识抽取仍可能影响评测结果。因此,OpenTumorBoard更适合被视为研究和压力测试工具,而不是替代医生或直接用于临床决策的系统。
它的价值在于把评测重点从“模型知道什么”推进到“模型能否与多专业团队共同推理”。随着医疗智能体从单点问答走向复杂工作流,这类基于真实讨论轨迹的基准,可能成为衡量可靠性、协作能力和决策一致性的重要基础。
评论
正在确认登录状态……
正在加载评论……