아티클 목록으로
모델 평가

See2Think: 멀티모달 모델은 정말 중간 시각 상태를 활용할까

약 3분 소요

도입

멀티모달 대형 언어 모델은 점점 더 추론 과정에서 스케치, 이미지 주석, 도구 호출, 중간 이미지를 활용하는 방식으로 발전하고 있다. 겉으로는 모델이 시각 정보를 보며 단계적으로 생각하는 것처럼 보인다. 하지만 중요한 질문이 남는다. 모델이 만든 중간 시각 상태가 실제 판단에 쓰이고 있는가, 아니면 그럴듯한 추론 과정을 보여주기 위한 부가 산물에 가까운가?

논문 See2Think: Do Multimodal Models Really Use Intermediate Visual States? 는 이 질문을 평가하기 위한 프레임워크를 제시한다. 단순히 최종 답이 맞았는지 확인하는 데서 멈추지 않고, 모델이 어떤 시각 작업을 선택했는지, 그 결과가 어떻게 렌더링됐는지, 이후 추론이 그 시각 상태를 얼마나 반영했는지를 함께 분석한다.

핵심 내용

  • 결과보다 과정을 보는 평가: See2Think는 See2ThinkBench와 Visual Action-of-Thought, 즉 VAoT로 구성된다. VAoT는 텍스트 사고, 시각 행동, 렌더링된 상태, 후속 추론을 기록해 최종 답변 뒤의 과정을 진단할 수 있게 한다.
  • 시각 의존 과제 중심 설계: See2ThinkBench는 1200개의 개방형 문제로 구성되며 12개 과제 범주를 다룬다. 범위는 2D 구조, 3D 장면, 실제 세계 추론을 포함한다. 설계의 핵심은 텍스트 단서만으로 풀 수 있는 샘플을 줄이고, 시각 추론 능력을 더 직접적으로 확인하는 것이다.
  • 항상 우세한 설정은 없음: 연구진은 대표적인 독점 모델과 오픈소스 멀티모달 모델을 통제된 추론 설정에서 평가했다. 결과는 시각 추론 성능이 모델과 실행 환경에 크게 의존하며, 모든 과제에서 일관되게 우세한 단일 설정은 없다는 점을 보여준다.
  • 가장 뚜렷한 병목은 렌더링: 모델은 과제와 관련된 시각 작업을 고르는 데에는 비교적 강점을 보인다. 그러나 그 의도를 정확하고 유용한 중간 시각 상태로 렌더링하는 과정은 여전히 어려운 문제로 남아 있다.
  • 시각 상태 의존성은 개입으로 확인 가능: 과제와 관련된 손상된 피드백을 제공했을 때, 통제된 개입에서 정확도가 10%포인트 이상 떨어졌다. 이는 중간 시각 상태가 모델 행동에 실제 영향을 줄 수 있음을 시사한다. 다만 피드백을 많이 반영한다고 해서 반드시 정확도가 높아지는 것은 아니다.

의미와 영향

See2Think의 의의는 멀티모달 추론 평가를 최종 점수 중심에서 과정 진단 중심으로 확장했다는 데 있다. 최종 답만으로는 모델이 시각 증거를 근거로 추론했는지, 잘못된 중간 과정을 거치고도 우연히 맞혔는지, 또는 시각 채널을 거의 우회했는지 구분하기 어렵다.

모델 개발 관점에서 이 연구는 개선 방향이 단순한 언어 추론 강화에만 있지 않음을 보여준다. 중간 이미지를 더 충실하게 생성하고 렌더링하며, 그 결과를 후속 추론에 안정적으로 연결하는 능력이 중요하다. 평가 체계 측면에서도 시각적 사고나 도구 기반 추론을 주장하는 모델이라면 행동 선택, 시각 상태 품질, 피드백 활용까지 함께 검증해야 한다.

결국 See2Think는 중간 시각 상태의 가능성을 부정하지 않는다. 오히려 그것이 모델 행동에 영향을 줄 수 있음을 보여주면서도, 현재 시스템에는 분명한 간극이 있음을 지적한다. 적절한 시각 작업을 고르는 것과, 그것을 정확히 그리고 실제 추론에 활용하는 것은 아직 같은 능력이 아니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
AI 에이전트는 개방형 AI 연구를 수행할 수 있을까? 두 건의 섀도 평가가 준 초기 증거
모델 평가
cctest.ai
모델 평가

AI 에이전트는 개방형 AI 연구를 수행할 수 있을까? 두 건의 섀도 평가가 준 초기 증거

새 논문은 미발표 고품질 논문의 핵심 연구 질문을 AI 에이전트에 맡기고 원저자가 평가하는 ‘섀도 평가’를 제안했다. 결과는 현재 에이전트가 엔지니어링은 해내지만, 개방형 연구의 핵심 판단에는 여전히 취약하다는 점을 보여준다.

더 보기
CCTest · Blog
StealthBench: 자율 보안 에이전트의 ‘은밀한 수행 능력’을 평가하다
모델 평가
cctest.ai
모델 평가

StealthBench: 자율 보안 에이전트의 ‘은밀한 수행 능력’을 평가하다

StealthBench는 자율 offensive-security agents를 단순히 취약점을 찾는 능력이 아니라, 노출과 피해를 줄이며 임무를 수행하는 능력으로 평가한다. 논문 결과는 현재 모델들이 OPSEC 측면에서 아직 안정적이지 않음을 보여준다.

더 보기
CCTest · Blog
SecRespond: 침해 이후 대응 능력으로 AI 에이전트를 평가하다
모델 평가
cctest.ai
모델 평가

SecRespond: 침해 이후 대응 능력으로 AI 에이전트를 평가하다

SecRespond는 침해된 호스트의 포렌식 디스크 스냅샷과 보안 제품 증거를 바탕으로 AI 에이전트의 사고 대응 능력을 평가하는 벤치마크입니다. 연구 결과, 현재 모델은 명시적 경고는 비교적 잘 따라가지만 조용한 침입 탐지와 완전한 복구 계획에는 한계를 보였습니다.

더 보기