Enoki, 통합 사실 표현으로 다단계 환각 탐지 효율화
대규모 언어 모델은 자연스럽고 유창한 답변을 만들지만, 근거가 부족한 사실을 함께 생성할 수 있다. 의료, 법률, 연구처럼 오류 비용이 큰 영역에서는 답변 전체를 참 또는 거짓으로 표시하는 것만으로 충분하지 않다. 어떤 사실이 증거로 뒷받침되지 않았는지, 그리고 그 문제가 답변의 어느 부분에 나타났는지를 함께 보여줘야 한다. ‘Enoki: Efficient Multi-Level Hallucination Detection’은 이 두 요구를 하나의 처리 구조로 연결하는 프레임워크를 제안한다.
배경: 검증과 위치 탐지의 간극
환각 탐지 연구는 크게 두 방향으로 나뉜다. 주장 수준 방법은 답변을 검증 가능한 사실 단위로 나누고 각 주장이 증거와 부합하는지 판단한다. 결과를 설명하기 쉽다는 장점이 있다. 반면 스팬 수준 방법은 지원되지 않는 단어와 구절을 직접 표시하므로 편집, 감사, 사용자 피드백에 유용하다.
두 기능을 동시에 제공하려면 일반적으로 분해, 검증, 정렬 단계가 모두 필요하다. LLM 중심 파이프라인은 여러 번의 호출로 비용과 지연이 커질 수 있고, 모듈형 시스템은 검증된 주장과 원문 스팬 사이의 별도 매핑을 요구한다. Enoki는 이 매핑 문제를 별도 모듈로 추가하지 않고, 텍스트에 연결된 관계 사실을 공통 중간 표현으로 활용해 해결하려 한다.
핵심 내용
- 관계 사실을 공통 단위로 사용한다. Enoki는 엔터티 사이의 속성, 행동, 관계 등을 원문 위치 정보와 함께 추출한다. 같은 사실이 검증 단위이면서 원문 위치를 가리키는 기준이 된다.
- 검증 결과를 원문으로 투영한다. 추출된 사실을 증거와 비교하고, 지지되지 않는 사실이 발견되면 보존된 텍스트 앵커를 이용해 관련 스팬을 찾는다. 별도의 주장—스팬 정렬 단계가 필요하지 않다.
- 여러 추출 방식을 수용한다. LLM 기반, 인코더 기반, 규칙 기반 추출기를 공통 인터페이스로 사용할 수 있다. 시스템은 정확도와 추론 비용 사이의 균형을 목적에 맞게 조정할 수 있다.
- 세밀한 진단을 목표로 한다. 논문이 제시한 결과에 따르면 Enoki는 강력한 주장 수준 시스템과 경쟁력을 유지하면서, 스팬 수준과 엔터티 수준 위치 탐지에서 더 나은 성능을 보였다.
- 이중 수준 데이터셋을 제공한다. EnokiQA는 주장 검증과 스팬 위치 탐지에 대응하는 주석을 함께 제공해 두 능력을 연계해 평가할 수 있도록 한다.
의미와 남은 과제
Enoki의 핵심은 환각을 단순한 분류 문제로만 보지 않는 데 있다. “이 사실은 증거로 뒷받침되는가?”와 “어느 문장을 수정해야 하는가?”를 동일한 표현에서 도출하므로, 검색 증강 생성, 자동 문서 검토, 고위험 질의응답에 더 실용적인 결과를 제공할 가능성이 있다.
공통 표현은 시스템 구성 측면에서도 장점이 있다. 지연 시간이나 예산에 따라 무거운 LLM 추출기를 가벼운 인코더 또는 규칙 기반 방식으로 바꾸더라도 후속 검증과 위치 탐지 흐름을 유지할 수 있기 때문이다. 이는 다양한 비용 조건에서 여러 추출 방식을 비교하려는 개발팀에 유용하다.
다만 제공된 자료에는 구체적인 벤치마크 점수, 하드웨어 조건, 오류 사례가 포함되어 있지 않다. 따라서 정확도와 비용 측면의 우위를 세부적으로 판단하려면 논문 전체의 실험 결과를 확인해야 한다. 실제 적용에서는 추출 오류와 증거의 품질이 최종 위치 탐지 결과에 직접 영향을 줄 가능성도 검토해야 한다.
그럼에도 Enoki는 생성 텍스트를 근거와 연결된 사실로 표현하고, 검증 결과를 원문 위치로 되돌리는 명확한 방향을 제시한다. 이는 더 설명 가능하고 효율적인 환각 평가 도구를 설계하는 데 참고가 될 수 있다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…