World Embedding Benchmark, 영상 모델의 물리 이해를 검증하다
들어가며
영상 생성과 월드 모델의 경쟁은 이제 화면이 그럴듯한지를 넘어, 움직임과 상호작용이 실제 물리 법칙을 따르는지로 확장되고 있다. 물체가 충돌하는 방식, 유체가 흐르는 모습, 빛이 변화하는 과정이 자연스럽지 않다면 높은 시각 품질만으로는 충분하지 않다. 그렇다면 영상 임베딩은 실제로 물리 정보를 담고 있을까? 그리고 그 정보를 텍스트나 생성 모델이 활용할 수 있을까? World Embedding Benchmark는 이 질문을 체계적으로 평가하기 위해 제안됐다.
물리 표현을 위한 통제된 평가 환경
벤치마크는 80개 물리 계열에서 생성한 8,000개의 통제된 시뮬레이션 사례로 구성된다. 범위는 유체역학, 고체역학, 동역학, 광학 및 전자기학을 아우른다. 각 사례는 렌더링된 영상과 시뮬레이션에서 도출한 물리 주석을 함께 제공한다.
실제 영상만으로 물리 이해를 평가하면 장면의 외형과 물리 파라미터를 원하는 방식으로 통제하기 어렵다. 반면 시뮬레이션에서는 파라미터와 시각적 조건을 체계적으로 바꿀 수 있다. 따라서 모델이 단순한 외관을 기억한 것인지, 특정 물리 변화를 포착한 것인지 비교적 명확하게 분석할 수 있다.
평가 과제는 세 가지다.
- 텍스트-영상 검색: 물리 과정을 설명하는 문장과 관련 영상을 찾아 연결한다.
- 물리 속성 회귀: 고정된 영상 임베딩에서 시뮬레이션의 정량적 속성을 복원한다.
- 영상-설명 쌍 분류: 여러 설명 중 해당 영상의 물리적 상황을 정확히 설명하는 항목을 선택한다.
검색과 쌍 분류는 영상과 언어 사이의 물리적 정렬을 주로 측정한다. 속성 회귀는 임베딩 내부에 수치 정보가 남아 있고, 간단한 도구로 이를 꺼낼 수 있는지를 본다. 두 능력을 나눠 보는 것이 이 연구의 핵심이다.
물리 신호가 있어도 쉽게 사용할 수 있는 것은 아니다
평가된 사전학습 옴니모달 임베딩 모델은 물리 관련 검색에서 약한 성능을 보였다. 같은 물리 계열 안에서 설명과 영상을 맞히는 쌍 분류도 거의 무작위 수준에 가까웠다. 일반적인 시각 정보를 잘 표현하는 모델이라도, 영상 속 변화를 정확한 물리 설명과 대응시키지는 못할 수 있다는 뜻이다.
그러나 가벼운 프로브를 사용하면 고정된 영상 임베딩에서 유용한 물리 정보를 복원할 수 있었다. 즉 물리 신호가 표현 안에 존재하더라도, 언어와 연결하거나 검색에 사용할 수 있는 구조로 정리되어 있지 않을 수 있다. 정보의 존재와 정보의 활용 가능성은 서로 다른 문제다.
연구진은 물리 관련 영상-텍스트 쌍을 이용한 지속적 대조 학습도 실험했다. 그 결과 검색과 쌍 분류는 개선됐지만, 물리 속성 회귀는 악화됐다. 언어와의 정렬을 강화하는 과정이 정량 예측에 유리한 세밀한 표현 구조를 바꿀 수 있음을 보여주는 결과다. 따라서 하나의 임베딩을 모든 물리 작업에 최적화하려면 이런 상충 관계를 고려해야 한다.
검색과 생성을 연결하는 물리 표현
추가 실험에서는 임베딩으로 MiniMax-H3에 제공할 물리적으로 관련된 참조 영상을 검색하고, 이를 검색 증강 영상 생성에 활용했다. 보고된 결과에 따르면 참조 영상은 생성 결과의 물리적 충실도를 높였으며, 검색 모델이 강할수록 개선 폭도 커졌다. 자료에 따르면 물리 적응형 LCO-Embedding-Omni가 해당 설정에서 가장 강한 성능을 기록했다.
이 연구의 의미는 월드 모델을 단일 점수로 평가해서는 안 된다는 데 있다. 시각적 품질, 언어와의 정렬, 정량적 물리 정보의 복원은 서로 다른 능력이다. 연구팀은 시뮬레이션 엔진, 전체 데이터셋, 평가 코드, 학습 모델과 체크포인트를 공개할 계획이라고 밝혔다. 이러한 자원은 인식과 검색, 생성을 연결하는 물리 기반 표현을 재현 가능한 방식으로 연구하는 데 활용될 수 있다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…