HappyWorld-Bench, 상호작용 속 세계 모델의 신뢰성을 검증하다
들어가며
세계 모델의 성능은 이제 결과물이 얼마나 사실적으로 보이는지만으로 판단하기 어렵습니다. 에이전트가 환경을 탐색하고 여러 행동을 수행한 뒤 이전 장소로 돌아가거나, 세계의 일부를 수정했을 때에도 같은 상태와 규칙을 유지해야 하기 때문입니다. HappyWorld-Bench는 이러한 상호작용 과정에서 세계 모델이 얼마나 신뢰할 수 있는지를 측정하기 위해 설계된 종합 평가 기준입니다.
핵심 구성
- 세 가지 평가 트랙. 영상 세계 모델, 공간 세계 모델, 체화 세계 모델을 각각 평가하면서 공통적으로 세계의 신뢰성을 살펴봅니다.
- 6단계 능력 체계. 생성적 구성에서 통합 세계 모델링까지 세계 능력을 W1~W6으로 정리해 단계적인 평가를 시도합니다.
- 생성 이후의 행동에 집중. 장기 롤아웃, 재방문, 물체 배치, 장면 편집, 다단계 행동, 물리 규칙과 행동 조건의 변경에 대한 대응을 검사합니다.
- 자동 평가와 인간 평가의 결합. HappyWorld-Arena는 인간 A/B 비교를 진행하고 모델 단위 Elo 점수를 산출합니다. 자동 지표는 행동이 지시대로 실행됐는지를 보완적으로 측정합니다.
- 다양한 테스트 규모. 1138개의 영상 프롬프트, 300개의 공간 장면, 254개의 체화 테스트 사례를 사용하며 영상 14개 모델, 공간 9개 시스템, 체화 8개 후보를 평가합니다.
평가 결과
세 트랙 모두에서 아직 뚜렷한 신뢰성 격차가 나타났습니다. 영상 모델은 긴 롤아웃을 수행하거나 앞서 방문한 장면을 다시 찾을 때 일관성이 떨어집니다. 짧은 영상 안에서는 자연스러운 결과를 만들더라도, 시간이 흐른 뒤 동일한 세계 상태를 계속 유지하는 일은 별개의 문제입니다.
공간 모델에서는 지시를 이해하는 능력과 정확하게 실행하는 능력 사이에 차이가 확인됩니다. 자료에 제시된 최고 성능은 물체 배치 정확도 70.14%, 편집 실행률 73.33%입니다. 즉 일부 공간 지시는 처리할 수 있지만, 요구된 위치에 정확히 배치하거나 장면을 정해진 방식으로 수정하는 과정에는 여전히 상당한 오류가 남아 있습니다.
체화 모델은 여러 단계의 행동을 수행하는 동안 환경 상태를 보존하는 데 어려움을 겪습니다. 행동 조건이나 물리 규칙이 바뀌었을 때 그 변화에 정확히 대응하는 것도 쉽지 않습니다. 로봇과 에이전트 환경에서는 한 단계의 상태 추정 오류가 이후 계획과 제어의 실패로 이어질 수 있다는 점에서 특히 중요합니다.
의미와 영향
HappyWorld-Bench는 세계 모델 평가의 기준을 “생성된 세계가 그럴듯해 보이는가”에서 “탐색과 수정 이후에도 그 세계를 믿고 사용할 수 있는가”로 확장합니다. 시각적 품질, 상태 일관성, 행동 반응, 개입 이후의 예측 가능성을 분리해 측정하고 하나의 틀 안에서 비교한다는 점이 핵심입니다.
개발자에게는 렌더링이나 생성 품질만 개선해서는 충분하지 않다는 메시지를 줍니다. 향후 모델은 더 강한 상태 추적, 장기 일관성, 행동 조건 기반 예측, 규칙 변화에 대한 강건성을 갖춰야 합니다. 게임, 시뮬레이션, 로보틱스, 에이전트 시스템을 도입하는 사용자에게도 이 기준은 인상적인 데모와 지속적인 상호작용에 견디는 시스템을 구분하는 데 도움이 됩니다. 세계 모델의 목표는 한 번 그럴듯한 세계를 만드는 것이 아니라, 세계가 탐색되고 바뀌는 동안에도 그 논리를 유지하는 것입니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…