아티클 목록으로
모델 평가

VLM은 무엇에 답하지 말아야 하는지도 알아야 한다

약 4분 소요

들어가며

좋은 시각언어 모델(VLM)은 모든 질문에 답하는 모델이 아닙니다. 이미지에 없는 정보를 지어내지 않고, 잘못된 전제를 바로잡으며, 주어진 입력만으로 판단할 수 없는 내용에는 한계를 밝혀야 합니다. 실행할 수 없는 작업이나 안전상 문제가 있는 요청에도 적절한 거부가 필요합니다.

현실에서 특히 어려운 상황은 질문 전체가 답할 수 있거나 답할 수 없는 경우가 아닙니다. 사용자가 이미지 속 물체의 색상을 묻는 동시에, 사진에 드러나지 않은 인물의 사적 정보를 추론하라고 요구할 수 있습니다. 이때 바람직한 모델은 질문 전체를 거부하지 않고 확인 가능한 부분에는 답하면서, 나머지는 왜 답할 수 없는지 설명해야 합니다.

KoNA가 평가하는 것

논문은 VLM의 ‘선택적 비순응’을 측정하는 KoNA 벤치마크를 제안합니다. 평가 범주는 다음 다섯 가지입니다.

  • 잘못된 전제: 사실과 다르거나 근거가 없는 가정을 바로잡는 능력
  • 시각적 접근 불가: 이미지에 없는 정보를 추측하지 않는 능력
  • 보편적 미지: 시각 입력만으로는 확정할 수 없는 질문에 단정하지 않는 능력
  • 작업 실행 가능성: 모델이나 현재 입력의 범위를 넘어선 작업을 수행하는 척하지 않는 능력
  • 안전성: 직접적인 지원을 제공해서는 안 되는 요청을 거부하는 능력

KoNA는 질문 단위와 구성 요소 단위의 비순응을 모두 살핍니다. 하나의 문제 요소를 단일 질문에 넣고, 같은 요소를 답할 수 있는 내용과 결합한 복합 질문에도 포함합니다. 여기에 완전히 답할 수 있는 대조 질문을 더해, 모델이 필요한 부분만 거부했는지 아니면 안전한 내용까지 한꺼번에 거부했는지를 구분합니다.

주요 결과

여러 오픈소스 및 폐쇄형 VLM을 평가한 결과, 거부·정정·보류 판단은 아직 안정적이지 않았습니다. 복합 질문에서는 문제가 더 뚜렷해졌습니다. 모델은 잘못된 전제를 그대로 받아들여 추론을 이어가거나, 이미지에서 확인할 수 없는 세부사항을 만들어낼 수 있습니다. 반대로 위험하거나 답할 수 없는 요소가 하나만 포함돼도, 원래 답할 수 있었던 부분까지 모두 거부하는 경우가 나타났습니다.

연구진은 선택적 비순응을 요구하는 KoNA 사례와 완전히 답할 수 있는 사례를 사용해 소형 오픈 모델을 미세조정했습니다. SFT 이후 GRPO를 적용하자 비순응 정확도가 크게 향상됐고, 완전 답변 가능 과제와 일반 벤치마크 성능은 대체로 유지됐습니다. 이는 단순히 거부율을 높이는 것보다, 답변과 거부의 경계를 정밀하게 학습하는 것이 중요하다는 점을 보여줍니다.

의미와 영향

이 능력은 멀티모달 비서, 이미지 질의응답 시스템, 도구를 사용하는 AI 에이전트에 중요합니다. 신뢰할 수 있는 응답은 직접 답변, 전제 수정, 근거에 기반한 보류, 안전 거부를 상황에 맞게 결합해야 합니다. 안전성을 ‘전부 답하기’와 ‘전부 거부하기’의 단순한 스위치로 다루는 방식만으로는 부족합니다.

KoNA는 기존의 전체 질문 단위 평가가 놓치는 문제도 드러냅니다. 복합 질문을 사용하면 모델이 지나치게 순응했는지, 지나치게 거부했는지를 나눠 볼 수 있습니다. 향후 학습에는 구성 요소 단위의 감독 데이터와 함께, 거부의 정확성, 답할 수 있는 내용의 처리 비율, 주장과 시각적 근거의 일치 여부를 함께 측정하는 지표가 필요할 것입니다.

핵심 교훈은 분명합니다. VLM의 발전은 더 많은 지식을 갖게 하는 데서 끝나지 않습니다. 이미지와 과제, 그리고 모델 자신이 정당화할 수 있는 범위를 인식하도록 만드는 일도 그만큼 중요합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
τ^τ-Bench, 코딩 에이전트의 실제 에이전트 납품 능력을 평가하다
모델 평가
cctest.ai
모델 평가

τ^τ-Bench, 코딩 에이전트의 실제 에이전트 납품 능력을 평가하다

τ^τ-Bench는 코드 생성이 아니라 현실적인 업무 제약 속에서 사용 가능한 에이전트를 구축하고 납품하는 능력을 평가한다. 현재 시스템과 전문가가 작성한 참조 구현 사이에는 여전히 큰 격차가 확인됐다.

더 보기