OmniConfess, 멀티모달 모델이 환각을 만든 근거를 추적하다
서론
텍스트, 이미지, 오디오, 비디오를 함께 처리하는 멀티모달 대규모 언어 모델은 더 다양한 증거를 활용할 수 있습니다. 그러나 입력 정보가 많아진다고 해서 답변이 항상 정확해지는 것은 아닙니다. 여러 모달리티의 정보가 충돌하거나 모델이 잘못된 채널에 의존하면, 그럴듯하지만 사실과 다른 환각이 발생할 수 있습니다.
특히 오류가 발견된 뒤에도 어떤 증거가 해당 주장을 뒷받침했는지는 쉽게 알기 어렵습니다. OmniConfess는 이 문제를 겨냥한 학습 없는 추론 시점 방법입니다. 모델을 다시 훈련하기보다 이미 만들어진 후보 답변을 분석해, 각 토큰이 어떤 증거에 의존하는지 확인합니다.
작동 방식
OmniConfess의 절차는 세 단계로 정리할 수 있습니다.
- 후보 답변 고정: 모델이 생성했거나 입력으로 주어진 답변을 분석 대상으로 삼습니다.
- 증거 채널 개입과 재점수화: 텍스트, 이미지, 오디오, 비디오 등 채널을 통제한 조건에서 후보 답변을 토큰 단위로 다시 평가합니다. 특정 채널을 바꿨을 때 토큰 점수가 얼마나 달라지는지 비교해 의존성을 추정합니다.
- 분석 결과를 수정에 활용: 토큰과 채널의 관계를 구조화한 “confession”을 만들고, 관련 증거에 의해 뒷받침되는 내용은 보존합니다. 반대로 무관하거나 서로 충돌하는 증거가 이끈 주장은 수정하도록 유도합니다.
여기서 confession은 모델이 자연어로 자기 판단을 설명하는 기능이라기보다, 답변의 각 부분이 어떤 채널에 기대고 있는지를 기록하는 분석 신호에 가깝습니다.
평가와 한계
연구진은 평가를 위해 OmniHalluBench를 구축했습니다. 이 벤치마크는 6개 데이터셋에서 가져온 3540개 예제로 구성되며, 텍스트·이미지·오디오·비디오 환경과 판단 및 자유 형식 생성 과제를 모두 포함합니다. 제공된 초록에 따르면 OmniConfess는 서로 다른 모달리티와 과제 설정에서 환각을 완화하는 효과를 보였습니다.
다만 현재 자료에는 구체적인 기준선, 평가 지표, 과제별 개선 폭이 제시되어 있지 않습니다. 따라서 방법의 방향성과 실험적 가능성은 설명할 수 있지만, 경쟁 기법보다 얼마나 우수한지는 판단하기 어렵습니다. 채널 개입에 필요한 계산 비용, 개입 결과의 안정성, 여러 모달리티가 동시에 오류에 기여할 때의 귀속 정확도 역시 전체 논문과 공개 코드로 확인해야 할 부분입니다.
의미와 영향
OmniConfess의 핵심적인 관점 전환은 “답변이 틀렸는가”에서 나아가 “틀린 주장을 어떤 증거가 떠받쳤는가”를 묻는 데 있습니다. 모든 불확실한 내용을 일괄 삭제하는 대신, 근거가 있는 표현과 의심스러운 증거에 의존한 표현을 구분해 선택적으로 수정할 가능성을 열어줍니다.
이 접근법이 다양한 모델과 실제 환경에서도 재현된다면 멀티모달 시스템의 사실성 개선과 모달리티 간 증거 충돌 분석에 활용될 수 있습니다. 그러나 토큰 수준의 귀속 신호가 곧 완전한 인과 설명을 의미하는 것은 아닙니다. 실제 효과와 비용은 더 폭넓은 평가와 재현 가능한 구현을 통해 검증되어야 합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…