아티클 목록으로
모델 평가

ActiveVision: 멀티모달 모델의 ‘능동적 관찰’을 묻는 시험

약 3분 소요

도입

인간의 시각은 한 장면을 한 번 훑고 끝나는 과정이 아니다. 우리는 먼저 가설을 세우고, 중요한 부분을 다시 보며, 증거를 모아 판단을 고친다. 남가주대학교 등이 참여한 연구진은 이런 과정을 ActiveVision이라는 벤치마크로 측정하려 했다. 핵심 질문은 현재의 멀티모달 대형언어모델(MLLM)이 정말로 능동적으로 관찰할 수 있는가이다.

기존의 많은 비전-언어 평가는 이미지 한 장과 질문 하나를 주고 최종 답을 채점하는 방식에 가깝다. 하지만 실제 시각 과제는 더 복잡하다. 세부 영역을 확인하고, 부분적인 결론을 검증하며, 부족한 증거를 찾아 다시 보는 과정이 필요하다.

핵심 요점

  • 정적 인식이 아니라 관찰 루프를 평가: ActiveVision은 3개 범주, 17개 과제로 구성된다. 과제들은 단순한 이미지 설명이나 한 번의 전체 인상만으로 풀기 어렵게 설계됐다.
  • 최신 모델도 크게 부진: 논문에 따르면 평가된 모델 중 최고 성능인 GPT-5.5도 공개된 최고 추론 노력 설정에서 10.6%의 항목만 해결했으며, 17개 과제 중 11개에서는 0점을 기록했다. 여러 추론·코딩 리더보드에서 강한 Claude Fable 5도 3.5%에 그쳤다.
  • 인간과의 격차가 뚜렷함: 인간 참여자 3명은 평균 96.1%를 기록했다. 이는 과제 자체가 불가능한 것이 아니라, 현재 모델이 특정한 시각적 능동성에서 약하다는 점을 시사한다.
  • 비전 코드 작성도 충분한 해결책은 아님: 모델이 직접 시각 처리 코드를 작성하고 실행하도록 해도 격차는 상당 부분 남았다. 실제 이미지에서는 코드가 불안정할 수 있고, 그 실패를 알아차리는 일 자체가 능동적 시각 인식을 요구하기 때문이다.

의미와 영향

ActiveVision이 던지는 메시지는 분명하다. 모델이 이미지를 그럴듯하게 설명하는 능력과, 필요한 증거를 찾아가며 관찰하는 능력은 다르다. 복잡한 장면 이해, 자동 검사, 로보틱스, 문서 분석, 이미지 기반 검색 같은 분야에서는 “무엇이 보이는가”뿐 아니라 “다음에 어디를 봐야 하는가”가 중요하다.

이 연구는 향후 멀티모달 모델 개발 방향에도 영향을 준다. 더 강한 언어 추론이나 더 큰 비전 인코더만으로는 충분하지 않을 수 있다. 논문은 지각과 추론을 닫힌 고리로 연결하는 구조와 학습 목표가 필요하다고 본다.

물론 ActiveVision이 기계 시각 지능 전체를 정의하는 것은 아니다. 그러나 정적 이미지 질의응답을 넘어, 모델이 어떻게 보고 확인하는지를 평가해야 한다는 점을 분명히 보여주는 벤치마크로 의미가 있다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
LLM은 왜 변하는 사용자 의도를 놓치는가
모델 평가
cctest.ai
모델 평가

LLM은 왜 변하는 사용자 의도를 놓치는가

새 논문은 단일 턴 벤치마크에서 강한 성능을 보이는 LLM이라도 실제 대화에서 계속 바뀌는 사용자 의도를 안정적으로 추적하지 못할 수 있다고 지적한다. 연구진은 기존 정적 과제를 동적 다중 턴 대화로 바꾸는 평가 프레임워크를 제안했다.

더 보기
CCTest · Blog
Tencent WorkBuddy Bench, 코딩 에이전트를 실제 업무 관점에서 평가하다
모델 평가
cctest.ai
모델 평가

Tencent WorkBuddy Bench, 코딩 에이전트를 실제 업무 관점에서 평가하다

Tencent WorkBuddy Bench는 코드, 웹, 오피스, 보안 영역에서 코딩 에이전트의 업무 수행 능력을 평가하는 벤치마크다. 공개 재현성을 유지하면서도 오염에 강한 태스크 구성 방식을 내세운 점이 핵심이다.

더 보기
CCTest · Blog
공간 추론은 말보다 그림으로: ProVisE의 평가 방식
모델 평가
cctest.ai
모델 평가

공간 추론은 말보다 그림으로: ProVisE의 평가 방식

ProVisE는 공간 과제가 항상 텍스트나 좌표로 답하기 적합하지 않다는 문제에서 출발한다. 이미지 생성 모델이 픽셀 위에 표시하거나 경로를 그리도록 하고, 이를 기존 벤치마크가 채점할 수 있는 구조화된 예측으로 변환한다.

더 보기