아티클 목록으로
모델 평가

무관한 이미지도 VLM의 판단을 흔든다: 평가 설계의 함정

약 3분 소요

문제의식

비전·언어 모델(VLM)은 이미지 설명을 넘어 데이터 라벨링, 콘텐츠 심사, 품질 평가에도 활용되고 있다. 인간 평가자를 대체할 수 있는지 판단하려면 모델의 능력과 평가 환경의 영향을 구분해야 한다. 특히 과제가 “문장만 보고 답하라”고 요구한다면, 함께 제공된 이미지는 결과에 영향을 주지 않아야 한다.

하지만 Technion 연구팀이 제안한 MIST(Misleading-Image Stress Test)는 무관한 이미지도 VLM의 판단을 흔들 수 있음을 보여준다.

MIST의 구성

MIST는 문자 그대로도, 비유적으로도 해석할 수 있는 표현을 포함한 영어 문장 200개로 구성된다. 각 문장은 다음 세 가지 조건에서 모델에 제시된다.

  • 정렬 이미지: 문장의 한 해석을 보여주는 이미지
  • 오도 이미지: 반대 해석을 보여주는 이미지
  • 이미지 없음: 문장만 제공

평가 지침은 라벨을 문장만으로 결정하도록 한다. 따라서 안정적인 심사 모델이라면 세 조건에서 같은 답을 내야 한다. 연구팀은 13개 VLM 심사 모델의 결과를 조사하고 인간 주석 결과와 비교했다.

이미지의 내용보다 존재가 중요했다

정렬 이미지가 들어갔을 때 라벨의 20.5%가 바뀌었고, 오도 이미지에서는 19.4%가 바뀌었다. 두 비율은 거의 같았으며, 이미지가 남아 있는 상태에서 ‘이미지를 무시하라’는 지시만 삭제했을 때의 11.6%보다 모두 높았다.

더 중요한 점은 변화의 방향이다. 정렬 이미지와 오도 이미지 사이에서 답이 달라진 사례 중, 이미지가 보여준 의미 쪽으로 이동한 비율은 37%에 불과했다. 모델이 이미지의 내용에 일관되게 끌려간 것이 아니라, 이미지가 입력에 포함되어 있다는 사실 자체가 판단을 불안정하게 만든 것으로 볼 수 있다.

이미지가 없을 때와 정렬 이미지 또는 오도 이미지가 있을 때를 비교해도 인간 주석과의 일치도는 개선되지 않았다. 별도의 alt-test를 통과한 7개 모델에서는 영향이 더 작았지만, 통과하지 못한 6개 모델과 마찬가지로 현상 자체는 남아 있었다.

평가와 배포에 주는 의미

이 결과는 VLM의 인간 대체성 평가가 모델의 능력만 측정하지 않을 수 있음을 시사한다. 프롬프트, 모달리티 조합, 이미지 배치, 지시문의 표현이 바뀌면 같은 모델도 다른 라벨을 낼 수 있다. 하나의 고정된 입력 구성에서만 정확도나 인간과의 유사성을 측정하면, 모델의 성능과 평가 설정이 만든 불안정성을 구분하기 어렵다.

따라서 후속 평가에는 이미지 없음, 관련 이미지, 충돌하는 이미지, 무관한 이미지 조건을 함께 포함할 필요가 있다. 단순한 정확도뿐 아니라 모델이 과제에서 허용된 근거를 사용했는지, 불필요한 모달리티에 얼마나 민감한지도 보고해야 한다.

MIST가 말하는 핵심은 VLM이 항상 이미지에 속는다는 뜻이 아니다. 유효한 정보를 제공하지 않는 모달리티도 판단을 흔들 수 있다는 점이다. 결국 VLM의 대체성을 평가할 때 측정되는 대상은 모델 하나가 아니라, 모델과 입력 환경이 결합된 전체 구성이다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
AutoDataBench, AI 연구 에이전트의 ‘데이터 지능’을 평가하다
모델 평가
cctest.ai
모델 평가

AutoDataBench, AI 연구 에이전트의 ‘데이터 지능’을 평가하다

AutoDataBench는 학습 프레임워크와 하이퍼파라미터, 연산 예산 등의 비데이터 요인을 통제하고 LLM 연구 에이전트의 데이터 진단·조직·구성 능력을 측정하는 테스트베드입니다. 데이터 개입의 효과를 사전에 예측하는 능력과 연구 궤적의 재활용 가능성도 함께 살펴봅니다.

더 보기
CCTest · Blog
AI 심사자에게 필요한 수사적 강건성, SciCore가 제시한 해법
모델 평가
cctest.ai
모델 평가

AI 심사자에게 필요한 수사적 강건성, SciCore가 제시한 해법

같은 과학적 내용을 다르게 표현한 원고에 AI 심사자가 다른 판단을 내릴 수 있습니다. 새 연구는 수사적 강건성을 별도 평가 기준으로 제안하고, 전체 원고와 구조화된 과학 핵심을 결합하는 SciCore를 소개했습니다.

더 보기
CCTest · Blog
CUA-SWE, 화면을 보고 수정까지 검증하는 소프트웨어 에이전트 평가
모델 평가
cctest.ai
모델 평가

CUA-SWE, 화면을 보고 수정까지 검증하는 소프트웨어 에이전트 평가

CUA-SWE는 코드 편집, 명령 실행, GUI 조작, 시각적 피드백 확인을 하나의 소프트웨어 엔지니어링 과제로 묶습니다. 코딩 에이전트와 컴퓨터 사용 에이전트 사이의 평가 공백을 다루는 것이 핵심입니다.

더 보기