OpenTumorBoard, 암 다학제 진료에서 AI의 협업 추론을 시험하다
들어가며
암 다학제 진료는 단일 질문에 정답을 제시하는 작업과 다릅니다. 영상, 병리, 치료 이력, 환자의 경과, 수술 가능성 등 여러 정보가 전문 분야별로 제시되고, 의료진은 서로의 의견을 보완하거나 반박하면서 치료 방향을 좁혀 갑니다. OpenTumorBoard는 이러한 협업 과정 자체를 대규모 언어 모델의 평가 대상으로 삼았습니다.
데이터와 평가 방식
연구진은 YouTube에 공개된 종양 다학제 회의 219개를 전사해 611개 환자 사례와 19,157개 토론 턴을 구축했습니다. 자료에는 10개 전문 역할의 발언이 포함되며, 전체 녹화 시간은 12,534분입니다. 회의 중 전문가에게 제시된 질문은 16,215개입니다. 연구팀은 데이터셋과 리더보드, 코드, 자동 큐레이션 파이프라인도 제공할 예정입니다.
평가는 두 가지 설정으로 진행됩니다.
- SPECIALIST TURN: 실제 회의에서 특정 전문가에게 제시된 임상적으로 중요한 질문에 답한다.
- BOARD SIMULATION: 사례 요약과 슬라이드를 바탕으로 다중 턴 토론을 생성하고, 치료 권고·수술 계획·후속 조치·임상시험 매칭 등의 결론에 도달한다.
결과가 보여주는 한계
연구진은 14개의 범용 프런티어 모델과 의료 모델을 평가했습니다. 가장 뛰어난 모델도 전문가 답변과의 임상적 동등성에서 5점 만점에 3.43점을 기록했고, 실제 위원회 결론과의 일치도는 2.78점에 그쳤습니다. 모델이 개별 의학 정보를 어느 정도 다루더라도, 서로 다른 전문 의견을 통합하고 충돌을 조정해 합의로 이끄는 과정은 여전히 불안정하다는 뜻입니다.
이는 기존의 단일 턴 의료 질의응답 평가가 놓치는 부분을 보여줍니다. 그럴듯한 답변을 만드는 능력과 장기 병력, 여러 증거, 전문 역할의 차이를 유지하면서 실행 가능한 결론을 만드는 능력은 다릅니다. Board Simulation은 유창한 문장보다 지속적인 추론과 협업 구조 이해를 평가합니다.
지도 미세조정과 강화학습을 적용한 모델은 별도로 보류된 테스트 환경에서 성능이 향상됐습니다. 실제 회의의 토론 궤적이 평가 데이터뿐 아니라 협업형 의료 모델을 적응시키는 학습 자원으로도 활용될 수 있음을 시사합니다.
의미와 한계
세 명의 의학박사가 데이터 일부를 검토한 결과, 환자 사례의 정보 범위와 사실성이 높고 추출된 합의 결론도 실제 기록을 잘 반영하는 것으로 평가됐습니다. 다만 공개 회의가 모든 병원과 진료 문화를 대표한다고 볼 수는 없습니다. 전사, 사례 요약, 합의 추출 과정 역시 평가 결과에 영향을 줄 수 있습니다.
따라서 OpenTumorBoard는 의사를 대체하거나 곧바로 임상 의사결정에 사용할 시스템이 아니라, 연구와 스트레스 테스트를 위한 벤치마크로 이해해야 합니다. 이 프로젝트의 핵심 기여는 질문을 “모델이 의학 지식을 알고 있는가”에서 “복잡한 전문가 팀에 신뢰성 있게 참여할 수 있는가”로 확장한 데 있습니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…