WorldAuditBench, 멀티모달 에이전트의 3D 세계 감사 능력 평가
들어가며
가상 세계에서 활동하는 에이전트는 카메라 앞의 장면을 설명하는 것만으로는 충분하지 않습니다. 어디로 이동할지, 어느 영역을 더 살펴볼지, 이상 징후를 어떤 방식으로 확인할지까지 결정해야 합니다. WorldAuditBench는 멀티모달 에이전트를 3D 세계의 감사관처럼 다루며 이 복합적인 능력을 평가합니다.
벤치마크의 구성
이 벤치마크는 Unreal Engine 5와 Three.js로 제작된 13개 상호작용 환경에 213개 이상 탐지 과제를 배치했습니다. 과제는 다섯 가지 이상 유형을 포함하며, 공중에 떠 있는 물체, 통과할 수 있는 벽, 주변 장면과 어울리지 않는 물체 등이 사례로 제시됩니다. 에이전트는 제한된 탐색 예산 안에서 이동하고 관찰하며 증거를 수집한 뒤 이상을 식별해야 합니다.
따라서 과제에는 두 가지 능력이 함께 필요합니다.
- 행동과 탐색: 이동 경로와 조사 순서를 계획하고, 적은 행동으로 중요한 영역을 효율적으로 확인하는 능력
- 시각적 추론과 검증: 의심스러운 단서를 발견한 뒤 시점을 바꾸거나 가까이 이동해 실제 이상인지 확인하는 능력
비교한 두 가지 접근법
첫 번째는 시각-언어-행동 모델(VLA)이 먼저 환경을 탐색하고, 이후 시각-언어 모델(VLM)이 이상을 판정하는 파이프라인입니다. 이동과 해석을 두 단계로 나누는 방식입니다. 두 번째는 종단 간 VLM 에이전트가 시각적 추론 결과를 바탕으로 다음 행동을 직접 선택합니다. 관찰, 이동, 검증을 하나의 반복 과정으로 연결하려는 접근입니다.
다섯 개 최신 모델을 평가한 결과, 두 방식의 성공률은 6.6~42.3%에 머물렀습니다. 인간의 성과는 83.4%였습니다. 이는 모델이 장면을 묘사할 수 있더라도 체계적으로 탐색하거나, 불확실한 위치를 다시 확인하거나, 최종 판단을 뒷받침할 충분한 증거를 모으는 능력은 별개의 문제임을 보여줍니다.
의미와 영향
WorldAuditBench의 핵심은 ‘이상을 보았다’와 ‘이상을 찾아냈다’를 구분한 데 있습니다. 단순한 인식 정확도뿐 아니라 탐색 효율, 증거 수집, 관찰에 기반한 행동 선택을 하나의 평가 틀에서 다룹니다. 이는 체화형 에이전트, 월드 모델, 상호작용형 AI를 위한 현실적인 시험대가 될 수 있습니다.
앞으로의 시스템은 불확실성을 반영한 탐색 계획, 특정 가설을 시험하는 행동, 여러 관찰을 연결하는 추론을 갖춰야 합니다. 시각 인식만 강화해서는 인간과의 격차를 줄이기 어렵습니다. 이 벤치마크가 드러내는 본질적인 문제는 3D 환경에서 행동과 추론을 어떻게 결합할 것인가입니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…