BioEVAL, 생명공학 AI의 실험 추론 능력을 평가하다
들어가며
생물의학 분야의 대규모 언어 모델 평가는 지금까지 사실 회상이나 시험형 문제에 집중하는 경우가 많았습니다. 이런 방식은 모델이 특정 개념을 알고 있는지 보여주지만, 여러 논문에서 근거를 모으거나 실험 맥락을 파악하고, 실험 이미지에서 의미 있는 정보를 추출하는 능력까지 충분히 설명하지는 못합니다. arXiv에 소개된 BioEVAL은 이러한 공백을 겨냥한 생명공학 분야 벤치마크입니다.
핵심 내용
- 다기관·다분야 구성. 22개 연구 그룹이 참여했으며, 11개 주요 생명공학 세부 분야를 대상으로 박사과정 수준의 평가를 지향합니다.
- 연구 과정에 가까운 과제. 객관식 380문항 가운데 감사 이후 359문항을 최종 사용했습니다. 여기에 문헌 종합 과제 218개와 실험 이미지 해석을 포함한 멀티모달 문제 10개를 추가했습니다.
- 이중 품질 관리. 출제 그룹의 전문가 검토와 중앙 품질 관리를 거친 뒤, 평가가 끝난 후에는 정답률이 가장 높거나 낮은 객관식 문항을 대상으로 그룹 간 블라인드 감사를 진행했습니다. 그 결과 수정 또는 삭제가 필요한 21문항은 최종 결과에서 제외됐습니다.
- 클라우드와 로컬 모델을 함께 평가. ChatGPT, Gemini, Grok과 같은 클라우드 규모 모델뿐 아니라 소비자용 GPU에서 실행할 수 있는 로컬 모델도 포함했습니다.
- 과제별 성능 차이. 유지된 객관식 문제에서 최고 정확도는 90%, 문헌 종합 최고 유사도는 0.72, 소규모 멀티모달 문제의 최고 정확도는 80%였습니다. 다만 세부 분야별 편차가 컸고 이미지 문제의 표본도 적었습니다.
의미와 한계
BioEVAL의 중요한 점은 과학적 능력을 하나의 점수로 단순화하지 않는다는 데 있습니다. 기술 개념을 확인하는 단계, 여러 논문의 내용을 조직하는 단계, 실험 증거를 해석하는 단계를 나누어 평가함으로써 모델이 생명공학 연구 흐름의 어느 부분에서 유용한지 더 구체적으로 살펴볼 수 있습니다.
다만 객관식 정답률 90%를 실제 실험 설계나 문제 해결 능력으로 곧바로 해석해서는 안 됩니다. 객관식 문항은 현실의 연구 의사결정보다 단순할 수 있고, 문헌 종합의 유사도 점수도 사실 정확성, 출처 추적성, 증거의 중요도 판단과 인과 추론을 모두 반영하지는 않습니다. 멀티모달 과제 역시 10개에 불과하므로 80%는 확정적인 결론보다 초기 신호로 보는 편이 적절합니다.
모델 개발자에게 BioEVAL은 개선 방향을 제시합니다. 서로 다른 생명공학 분야를 오갈 때 성능을 안정화하고, 실험 맥락을 이해하며, 검증 가능한 근거에 기반해 문헌을 요약해야 합니다. 또한 이미지에서 관찰한 내용을 과학적 판단으로 연결하는 능력도 필요합니다.
BioEVAL은 표준화된 절차에 따라 전문가가 문항을 추가하고 새로운 모델을 평가할 수 있도록 확장형으로 운영될 예정입니다. 표본과 과제 유형이 늘어나면서 품질 관리가 유지된다면, 이 벤치마크는 AI가 생명공학에서 단순 질의응답을 넘어 연구 보조 역할에 접근하고 있는지를 판단하는 기준이 될 수 있습니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…