무관한 이미지도 VLM의 판단을 흔든다: 평가 설계의 함정
문제의식
비전·언어 모델(VLM)은 이미지 설명을 넘어 데이터 라벨링, 콘텐츠 심사, 품질 평가에도 활용되고 있다. 인간 평가자를 대체할 수 있는지 판단하려면 모델의 능력과 평가 환경의 영향을 구분해야 한다. 특히 과제가 “문장만 보고 답하라”고 요구한다면, 함께 제공된 이미지는 결과에 영향을 주지 않아야 한다.
하지만 Technion 연구팀이 제안한 MIST(Misleading-Image Stress Test)는 무관한 이미지도 VLM의 판단을 흔들 수 있음을 보여준다.
MIST의 구성
MIST는 문자 그대로도, 비유적으로도 해석할 수 있는 표현을 포함한 영어 문장 200개로 구성된다. 각 문장은 다음 세 가지 조건에서 모델에 제시된다.
- 정렬 이미지: 문장의 한 해석을 보여주는 이미지
- 오도 이미지: 반대 해석을 보여주는 이미지
- 이미지 없음: 문장만 제공
평가 지침은 라벨을 문장만으로 결정하도록 한다. 따라서 안정적인 심사 모델이라면 세 조건에서 같은 답을 내야 한다. 연구팀은 13개 VLM 심사 모델의 결과를 조사하고 인간 주석 결과와 비교했다.
이미지의 내용보다 존재가 중요했다
정렬 이미지가 들어갔을 때 라벨의 20.5%가 바뀌었고, 오도 이미지에서는 19.4%가 바뀌었다. 두 비율은 거의 같았으며, 이미지가 남아 있는 상태에서 ‘이미지를 무시하라’는 지시만 삭제했을 때의 11.6%보다 모두 높았다.
더 중요한 점은 변화의 방향이다. 정렬 이미지와 오도 이미지 사이에서 답이 달라진 사례 중, 이미지가 보여준 의미 쪽으로 이동한 비율은 37%에 불과했다. 모델이 이미지의 내용에 일관되게 끌려간 것이 아니라, 이미지가 입력에 포함되어 있다는 사실 자체가 판단을 불안정하게 만든 것으로 볼 수 있다.
이미지가 없을 때와 정렬 이미지 또는 오도 이미지가 있을 때를 비교해도 인간 주석과의 일치도는 개선되지 않았다. 별도의 alt-test를 통과한 7개 모델에서는 영향이 더 작았지만, 통과하지 못한 6개 모델과 마찬가지로 현상 자체는 남아 있었다.
평가와 배포에 주는 의미
이 결과는 VLM의 인간 대체성 평가가 모델의 능력만 측정하지 않을 수 있음을 시사한다. 프롬프트, 모달리티 조합, 이미지 배치, 지시문의 표현이 바뀌면 같은 모델도 다른 라벨을 낼 수 있다. 하나의 고정된 입력 구성에서만 정확도나 인간과의 유사성을 측정하면, 모델의 성능과 평가 설정이 만든 불안정성을 구분하기 어렵다.
따라서 후속 평가에는 이미지 없음, 관련 이미지, 충돌하는 이미지, 무관한 이미지 조건을 함께 포함할 필요가 있다. 단순한 정확도뿐 아니라 모델이 과제에서 허용된 근거를 사용했는지, 불필요한 모달리티에 얼마나 민감한지도 보고해야 한다.
MIST가 말하는 핵심은 VLM이 항상 이미지에 속는다는 뜻이 아니다. 유효한 정보를 제공하지 않는 모달리티도 판단을 흔들 수 있다는 점이다. 결국 VLM의 대체성을 평가할 때 측정되는 대상은 모델 하나가 아니라, 모델과 입력 환경이 결합된 전체 구성이다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…