아티클 목록으로
월드 모델

Physis-Lang, 진화하는 물리 언어로 비디오 월드 모델 개선

약 3분 소요

들어가며

비디오 월드 모델은 보기 좋은 영상을 만드는 데서 그치지 않고, 물체와 환경이 시간에 따라 어떻게 변하는지 예측해야 합니다. 충돌 이후의 움직임, 힘이 작용한 결과, 사건의 시간 순서처럼 기본적인 물리 관계가 맞아야 합니다. 그러나 현재의 생성 모델은 시각적으로는 그럴듯한 영상을 만들면서도 물리 법칙이나 인과관계를 위반할 수 있습니다. Physis-Lang은 이 문제를 해결하기 위해 추가적인 잠재 표현이나 수치 신호만 도입하는 대신, 물리 과정을 설명하는 언어 자체를 체계적으로 개선하는 접근을 제시합니다.

핵심 방식

  • 물리 과정을 풍부한 언어로 표현합니다. Physis-Lang은 단순히 “물체가 움직인다”고 쓰지 않습니다. 관련된 객체, 원인, 상호작용, 지배 원리, 시간에 따른 변화, 결과를 함께 기술합니다. 캡션을 장면의 이름표가 아니라 물리 과정에 대한 설명으로 활용하는 방식입니다.
  • 원자적 주장 단위로 캡션을 평가합니다. PhysCapBench는 물리 과정을 작은 주장들로 분해하고 재현율과 정밀도를 측정합니다. 중요한 정보가 빠졌는지뿐 아니라, 영상에 존재하지 않는 물리적 내용을 캡션이 임의로 추가했는지도 확인할 수 있습니다.
  • 에이전트 루프가 지시문을 반복 수정합니다. 시스템은 주장 수준의 오류를 분석한 뒤 물리 캡션을 생성하는 지시를 개선합니다. 따라서 물리 언어는 한 번 정해진 템플릿이 아니라 평가 결과를 바탕으로 계속 최적화되는 표현이 됩니다.
  • 모델의 약점을 데이터 검색에 연결합니다. 모델이 부족한 물리 과정을 텍스트로 변환하고, 언어 기반 검색으로 해당 과정을 포함하면서 시각적으로도 다양한 영상을 찾습니다. 데이터 큐레이션과 모델 생성의 실패 분석이 하나의 피드백 루프로 연결되는 구조입니다.

결과와 영향

연구진은 Wan과 Cosmos 백본을 사용해 널리 활용되는 네 가지 물리 비디오 벤치마크에서 방법을 검증했습니다. 제공된 자료에 따르면 Physis-Lang은 여러 설정에서 물리적 개연성을 일관되게 높였습니다. 특히 오픈소스 Cosmos3-Nano를 기반으로 한 강화 모델이 논문 내 비교에서 독점 모델인 Veo 3.1을 넘어섰다고 보고했습니다.

이 연구의 핵심 의미는 언어를 단순한 프롬프트가 아니라 데이터, 학습, 생성 전반을 연결하는 공통 표현으로 본 데 있습니다. 같은 언어 표현이 영상의 물리 과정을 설명하고, 모델의 결함을 드러내며, 부족한 과정을 포함한 추가 데이터를 찾고, 원하는 시간적 변화를 정리하는 데 사용됩니다. 이는 더 큰 시각 모델이나 해석하기 어려운 잠재 신호에만 의존하지 않는 대안이 될 수 있습니다.

다만 현재의 결론은 논문에서 사용한 벤치마크와 백본 조합의 범위 안에서 이해해야 합니다. 복잡한 3차원 상호작용, 장기 시간 변화, 개방형 세계의 장면에서도 같은 효과가 유지되는지는 추가 검증이 필요합니다. 그럼에도 Physis-Lang은 월드 모델의 물리 일관성을 높이려면 더 많은 영상뿐 아니라 영상 속 인과관계와 시간 구조를 정확히 설명하는 언어도 중요하다는 연구 방향을 제시합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
세계 행동 모델의 일반화를 만드는 것은 미래의 완전한 생성이 아니다
월드 모델
cctest.ai
월드 모델

세계 행동 모델의 일반화를 만드는 것은 미래의 완전한 생성이 아니다

새로운 실증 연구는 세계 행동 모델이 추론 단계에서 미래 영상을 끝까지 생성하지 않아도 일반화 성능의 이점을 유지할 수 있음을 시사한다. 핵심은 행동을 결정하기 전에 미래 표현을 준비하는 과정이다.

더 보기