아티클 목록으로
모델 평가

SpanCalib-VLM, 비전언어 모델 환각 구간을 더 신뢰성 있게 탐지

약 3분 소요

왜 구간 단위 탐지가 필요한가

비전언어 모델은 이미지를 바탕으로 자연스러운 답변을 만들지만, 이미지에서 확인할 수 없는 물체나 속성을 사실처럼 덧붙일 수 있습니다. 이런 환각을 평가하려면 답변 전체를 참·거짓으로 분류하는 것만으로는 부족합니다. 근거가 없는 단어와 구절을 정확히 표시하고, 모델의 confidence가 실제 판단의 신뢰성을 제대로 반영하는지도 확인해야 합니다.

서로 다른 장점을 결합한 구조

SpanCalib-VLM은 두 종류의 모델을 함께 사용합니다.

  • 생성형 VLM: 미세조정된 Qwen3.5-4B-SHROOM-SFT가 환각 가능성이 있는 텍스트 구간을 후보로 제시합니다. 생성 모델은 후보를 넓게 찾는 데 강하지만, 과도하게 높은 확신을 보이거나 추론 지연이 커질 수 있습니다.
  • 멀티모달 시퀀스 태거: XLM-RoBERTa-Large에 SigLIP 비전 인코더의 정보를 cross-attention으로 결합합니다. 이 모듈은 텍스트 토큰을 결정론적으로 분류하고 더 잘 보정된 확률을 제공하지만, 보수적인 성향 때문에 일부 환각 구간을 놓칠 수 있습니다.

두 모델의 출력을 단순히 평균내는 대신, 논문은 Union-Calibrated Fusion을 사용합니다. 먼저 생성 모델이 가능한 후보를 넓게 수집한 뒤, 시퀀스 태거가 산출한 보정 확률로 후보를 재평가합니다. 이 방식은 생성 모델의 recall을 유지하면서 과도한 확신을 줄이는 것을 목표로 합니다.

결과를 어떻게 해석할까

SHROOM-Visions Shared Task의 영어 평가 분할에서 앙상블은 Pearson 보정 상관 0.41, 전체 IoU 0.39, 전체 탐지 정확도 70.7%를 기록했다고 보고됐습니다. 환각이 없는 응답을 대상으로 한 clean-response IoU는 0.91이었습니다. 이는 깨끗한 응답에서는 비교적 안정적인 판단을 보이지만, 복잡한 사례에서는 구간 경계와 confidence 보정에 추가 개선 여지가 있음을 보여줍니다.

IoU는 예측 구간과 정답 구간이 얼마나 겹치는지를 측정하고, 보정 상관은 confidence가 실제 정답 여부와 얼마나 함께 움직이는지를 살핍니다. 따라서 환각을 많이 찾는 것만으로는 충분하지 않습니다. 점수가 지나치게 공격적으로 책정되면 자동 위험 선별이나 사람의 검토 우선순위 결정에 활용하기 어렵습니다.

의미와 남은 과제

이 연구의 핵심은 환각 후보를 찾는 일과 확률을 신중하게 평가하는 일을 서로 다른 모델에 맡긴 데 있습니다. 보정된 구간 수준 신호는 위험 응답 순위화, 수동 검토 샘플 선별, 비전언어 모델 간 신뢰성 비교 등에 활용될 가능성이 있습니다.

다만 제공된 결과는 SHROOM-Visions 영어 평가 분할에 한정됩니다. 다른 언어, 이미지 유형, 모델 규모에서도 같은 성능이 유지되는지는 자료에서 확인되지 않았습니다. 따라서 실제 적용 범위를 판단하려면 추가 검증이 필요합니다. 저자들은 모델 가중치와 코드를 공개했으며, 후속 연구자가 재현 실험과 두 검출 방식의 조합을 검토할 수 있도록 했습니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
LoopArena, 코딩 에이전트의 장기 제어 능력을 평가하다
모델 평가
cctest.ai
모델 평가

LoopArena, 코딩 에이전트의 장기 제어 능력을 평가하다

LoopArena는 코딩 에이전트를 움직이는 제어 루프를 분리해, 한 모델이 다른 고정 코딩 에이전트를 장기 소프트웨어 작업에서 얼마나 잘 이끌 수 있는지 측정합니다. 결과는 안정적인 장기 제어가 여전히 어려운 과제임을 보여줍니다.

더 보기
CCTest · Blog
본 것을 정확히 실행할 수 있을까: EASEL이 평가한 멀티모달 에이전트
모델 평가
cctest.ai
모델 평가

본 것을 정확히 실행할 수 있을까: EASEL이 평가한 멀티모달 에이전트

EASEL은 멀티모달 모델이 이미지를 이해하는 데서 그치지 않고, 시각적 피드백을 바탕으로 도구 사용을 계속 수정할 수 있는지 평가한다. 핵심 과제는 참조 이미지와 같아지도록 캔버스를 단계적으로 그리는 것이다.

더 보기