아티클 목록으로
모델 평가

WorldAuditBench, 멀티모달 에이전트의 3D 세계 감사 능력 평가

약 3분 소요

들어가며

가상 세계에서 활동하는 에이전트는 카메라 앞의 장면을 설명하는 것만으로는 충분하지 않습니다. 어디로 이동할지, 어느 영역을 더 살펴볼지, 이상 징후를 어떤 방식으로 확인할지까지 결정해야 합니다. WorldAuditBench는 멀티모달 에이전트를 3D 세계의 감사관처럼 다루며 이 복합적인 능력을 평가합니다.

벤치마크의 구성

이 벤치마크는 Unreal Engine 5와 Three.js로 제작된 13개 상호작용 환경에 213개 이상 탐지 과제를 배치했습니다. 과제는 다섯 가지 이상 유형을 포함하며, 공중에 떠 있는 물체, 통과할 수 있는 벽, 주변 장면과 어울리지 않는 물체 등이 사례로 제시됩니다. 에이전트는 제한된 탐색 예산 안에서 이동하고 관찰하며 증거를 수집한 뒤 이상을 식별해야 합니다.

따라서 과제에는 두 가지 능력이 함께 필요합니다.

  • 행동과 탐색: 이동 경로와 조사 순서를 계획하고, 적은 행동으로 중요한 영역을 효율적으로 확인하는 능력
  • 시각적 추론과 검증: 의심스러운 단서를 발견한 뒤 시점을 바꾸거나 가까이 이동해 실제 이상인지 확인하는 능력

비교한 두 가지 접근법

첫 번째는 시각-언어-행동 모델(VLA)이 먼저 환경을 탐색하고, 이후 시각-언어 모델(VLM)이 이상을 판정하는 파이프라인입니다. 이동과 해석을 두 단계로 나누는 방식입니다. 두 번째는 종단 간 VLM 에이전트가 시각적 추론 결과를 바탕으로 다음 행동을 직접 선택합니다. 관찰, 이동, 검증을 하나의 반복 과정으로 연결하려는 접근입니다.

다섯 개 최신 모델을 평가한 결과, 두 방식의 성공률은 6.6~42.3%에 머물렀습니다. 인간의 성과는 83.4%였습니다. 이는 모델이 장면을 묘사할 수 있더라도 체계적으로 탐색하거나, 불확실한 위치를 다시 확인하거나, 최종 판단을 뒷받침할 충분한 증거를 모으는 능력은 별개의 문제임을 보여줍니다.

의미와 영향

WorldAuditBench의 핵심은 ‘이상을 보았다’와 ‘이상을 찾아냈다’를 구분한 데 있습니다. 단순한 인식 정확도뿐 아니라 탐색 효율, 증거 수집, 관찰에 기반한 행동 선택을 하나의 평가 틀에서 다룹니다. 이는 체화형 에이전트, 월드 모델, 상호작용형 AI를 위한 현실적인 시험대가 될 수 있습니다.

앞으로의 시스템은 불확실성을 반영한 탐색 계획, 특정 가설을 시험하는 행동, 여러 관찰을 연결하는 추론을 갖춰야 합니다. 시각 인식만 강화해서는 인간과의 격차를 줄이기 어렵습니다. 이 벤치마크가 드러내는 본질적인 문제는 3D 환경에서 행동과 추론을 어떻게 결합할 것인가입니다.

Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
EngiWorld가 보여준 엔지니어링 AI의 현재 수준
모델 평가
cctest.ai
모델 평가

EngiWorld가 보여준 엔지니어링 AI의 현재 수준

EngiWorld는 AI 에이전트가 전문 소프트웨어를 조작하는지를 넘어, 검증 가능한 엔지니어링 결과물을 설계 루프 끝까지 완성할 수 있는지를 평가한다. 실험 결과는 도구 사용 능력과 신뢰할 수 있는 업무 자동화 사이에 큰 격차가 있음을 보여준다.

더 보기
CCTest · Blog
MaLiang-Harness, 실행 가능한 코드를 시각적 완성도로 연결하다
모델 평가
cctest.ai
모델 평가

MaLiang-Harness, 실행 가능한 코드를 시각적 완성도로 연결하다

MaLiang-Harness는 이미지와 동영상 생성에서 코드가 실행되더라도 결과가 요구사항과 다를 수 있다는 ‘프로그램-시각’ 간극을 다룹니다. 프로그램 상태, 렌더링 증거, 수정 이력을 연결해 생성 과정을 반복적인 점검과 수정의 루프로 구성합니다.

더 보기