GAMUT, 장문 생성 평가를 ‘사실 완전성’으로 확장하다
도입
장문 생성의 사실성 평가는 그동안 주로 “모델이 말한 내용이 맞는가”에 집중해 왔습니다. 답변을 주장 단위로 분해하고, 검색을 통해 근거를 찾고, 참거짓을 확인하는 방식은 잘못된 사실을 잡아내는 데 효과적입니다. 하지만 이 방식은 다른 중요한 질문, 즉 “답변이 포함해야 할 정보를 충분히 담았는가”에는 약합니다. Meta AI 연구진이 제안한 GAMUT은 이 누락된 절반, 사실 완전성을 평가하려는 시도입니다.
핵심 요점
- 정확성에서 완전성으로: 답변이 명백히 틀리지 않아도 핵심 단계, 범주, 관계를 빠뜨리면 좋은 답변이라고 보기 어렵습니다. GAMUT은 모델이 말한 내용의 참거짓뿐 아니라, 말해야 할 내용을 얼마나 포함했는지를 봅니다.
- 두 단계 메타 루브릭: 먼저 구조화된 메타 루브릭으로 필요한 콘텐츠의 구성, 중요도, 순서, 사실 간 관계를 표현합니다. 이후 이를 LLM 심판이 안정적으로 채점할 수 있는 이진 체크 항목으로 기계적으로 컴파일합니다.
- 개방형 과제에 적합한 설계: 장문 답변은 단순한 독립 사실 목록으로 환원되기 어렵습니다. 개방형 집합의 포괄성, 순서가 있는 절차, 사실 간 의존관계가 중요할 수 있습니다. 두 단계 표현은 이런 구조를 보존한 뒤 채점 가능한 형태로 바꿉니다.
- 벤치마크 구성: GAMUT은 실제 웨어러블 이미지에 기반한 1,813개 질문으로 구성되며, 10개 다양한 영역을 다룹니다. 각 질문에는 근거가 뒷받침되고 전문가 주석자가 검증한 루브릭이 연결됩니다.
- 모달리티에 묶이지 않는 프레임워크: 사례는 멀티모달 사실성 평가로 구현됐지만, 프레임워크 자체는 이미지에 한정되지 않습니다. 연구진은 텍스트 전용 변형도 함께 공개했습니다.
- 모델 평가 결과: 연구는 14개 프런티어 및 오픈 웨이트 모델을 평가했습니다. 제공된 자료에 따르면 이 벤치마크는 실제로 어렵고, 모델 간 차이를 잘 드러내며, 심판 모델 선택에도 비교적 견고합니다. 최고 점수는 Gemini 3.1 Pro의 58.7%로 제시됐습니다.
의미와 영향
GAMUT의 의미는 새로운 순위표를 만드는 데 그치지 않습니다. AI 답변 품질을 “환각을 하지 않는가”에서 “필요한 사실을 빠뜨리지 않는가”로 넓혀 본다는 점이 중요합니다. 교육, 의료 설명, 현장 작업 지원, 이미지 이해 같은 상황에서는 맞지만 불완전한 답변도 사용자의 판단을 어렵게 만들 수 있습니다.
두 단계 루브릭은 실용적인 절충안이기도 합니다. 전문가가 완전한 답변의 상위 구조를 설계하고, 시스템이 이를 기계 채점 가능한 체크리스트로 바꾸면 전면 수작업 평가보다 확장성이 높고, 단순 체크리스트보다 표현력이 큽니다.
물론 완전성 평가는 루브릭 품질에 크게 의존합니다. 작성 비용, 영역 확장, 루브릭 편향 관리는 앞으로 살펴볼 과제입니다. 그럼에도 GAMUT은 사실성 평가가 “틀린 말을 하지 않는 것”뿐 아니라 “중요한 사실을 빠뜨리지 않는 것”까지 포함해야 함을 분명히 보여줍니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…