의료 오픈엔드 답변에서 검색 기반 사실 검증이 무너지는 이유
들어가며
의료 답변의 사실성을 평가할 때 검색 증강 방식은 유력한 선택지로 여겨진다. 모델의 기억에만 의존하지 않고 의학 문헌이나 권위 있는 자료에서 관련 내용을 검색한 뒤, 검증 모델이 해당 증거를 바탕으로 주장의 참·거짓을 판단하기 때문이다. 그러나 이번 연구는 벤치마크에서 높은 점수를 얻었다고 해서 시스템이 올바른 근거를 찾고 정확한 이유로 판단했다는 뜻은 아니라고 지적한다.
주요 결과
연구진은 오픈엔드 데이터셋인 MedExpert를 중심으로 3개의 폐쇄형 데이터셋을 함께 비교했다. 4개 검색 방식, 6개 검증 모델, 3개 코퍼스 설정을 시험한 결과 평가 형식에 따른 큰 격차가 나타났다. 폐쇄형 생의학 벤치마크에서는 F1이 0.78까지 올라갔지만, 임상 전문가가 주석을 단 MedExpert에서는 Qwen3 검색기와 GPT-5.4 검증기를 결합한 최상의 구성도 F1 0.06에 그쳤다.
첫 번째 문제는 검색 결과가 곧 증거는 아니라는 점이다. 검색기들이 반환한 문단 가운데 목표 주장을 직접 지지하거나 반박한 비율은 18.5~42%였다. 나머지는 주제와 관련되어 보이지만 다른 환자 집단이나 임상 조건을 다루거나, 증거 수준이 낮은 출처에서 나온 내용일 수 있다. 이런 자료를 모두 검증 모델에 넘기면 최종 판단 이전부터 오류 가능성이 커진다.
연구진은 검증 단계도 세분화했다. 증거 선택, 증거 해석, 임상적 추론, 추론과 증거의 연결, 확신도 조정, 최종 라벨의 일관성이라는 6단계다. 모델은 관련 문단을 찾아도 적용 대상의 차이를 놓칠 수 있고, 문헌이 직접 말하지 않은 결론을 일반적인 의학 지식으로 보완한 뒤 해당 출처가 뒷받침하는 것처럼 판단할 수 있다.
규모 확대로 해결되지 않는 이유
LLM을 활용한 패턴 유도 파이프라인으로 800개 주장·증거 쌍과 576개 추론 기록을 분석했으며, 사람과 임상의 판정으로 결과를 확인했다. 시험한 조건에서 추론량을 늘리면 토큰 사용량은 크게 증가했지만 재현율 개선은 나타나지 않았다. 더 큰 모델, 의료 분야 미세조정, 더 폭넓은 권위 웹 코퍼스도 주요 오류 패턴을 없애지 못했다.
이는 문제가 단순히 모델의 규모나 지식 부족에 있지 않을 수 있음을 보여준다. 오픈엔드 의료 답변에는 환자군, 적용 조건, 근거 수준이 서로 다른 세부 주장이 여러 개 포함된다. 검색 후 검증 파이프라인은 이 요소들을 동시에 맞춰야 하지만, 단일 F1 점수로는 증거를 못 찾은 것인지, 잘못 읽은 것인지, 임상 추론을 틀린 것인지, 과도한 확신으로 라벨을 붙인 것인지 알 수 없다.
의미와 영향
의료 RAG나 LLM 기반 평가기를 개발하는 팀은 정확도와 F1만 보고 시스템을 판단해서는 안 된다. 검색된 문단이 실제로 주장을 지지하는지, 정확한 환자 집단과 조건을 다루는지, 출처의 신뢰도와 근거 수준이 적절한지를 별도로 점검해야 한다. 검증 모델의 추론 과정도 단계별로 분석할 필요가 있다.
이번 연구는 검색 자체가 무용하다는 뜻이 아니다. 다만 인용이나 검색 결과의 존재만으로 사실성이 보장되지는 않는다는 의미다. 향후에는 주장을 더 세밀하게 분해하고, 임상 조건을 고려해 증거를 매칭하며, 불확실성을 명시적으로 관리하는 평가 방식이 필요하다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…