비디오 확산 모델은 왜 물리 법칙을 어길까? 어텐션의 문제
들어가며
비디오 확산 모델은 선명하고 그럴듯한 영상을 생성하지만, 시각적 품질이 물리적 일관성을 보장하지는 않는다. 물체가 갑자기 방향을 바꾸거나 프레임 사이에서 비정상적으로 이동하고, 가림이나 변형이 발생할 때 공간 관계가 무너지는 현상이 대표적이다. BUPT-CIST 연구진은 이 문제를 외부 물리 시뮬레이터나 특수 데이터만으로 해결하려 하지 않고, 모델 내부에서 움직임이 어떻게 결정되는지 분석했다.
움직임은 초기에 계획된다
논문은 초기 디노이징 단계를 모델의 암묵적인 움직임 계획 과정으로 해석한다. 분석 결과 모델은 대체로 물체의 대략적인 형태와 위치를 먼저 정한 뒤, 질감과 세부 정보를 추가한다. 초기에 형성된 공간적 선택이 강하게 굳어지면 이후 단계에서 궤적을 수정할 여지가 줄어든다.
연구진은 크로스 어텐션의 궤적 패턴과 각 어텐션 헤드의 인과적 기여도를 함께 조사했다. 그 결과 움직임 계획에 특히 중요한 일부 헤드를 찾아냈다. 모든 헤드가 움직임에 동일하게 관여하는 것이 아니라, 특정 헤드 집합이 공간적 선택을 주도할 수 있다는 의미다.
RoPE가 만드는 조기 고정
셀프 어텐션 분석은 회전 위치 임베딩(RoPE)을 주요 원인으로 지목한다. RoPE는 위치 관계를 표현하기 위한 장치지만, 초기 디노이징 단계에서는 공간 어텐션 감쇠를 지나치게 크게 만들 수 있다. 그러면 멀리 있는 후보 영역이 충분히 고려되지 않게 된다.
모델이 초기에 물리적으로 부적절한 위치를 선택하면, 인접 프레임에서 더 합리적인 후보 궤적이 억제된다. 그 결과 갑작스러운 점프, 미끄러짐, 불연속적인 움직임이 나타날 수 있다. 문제는 단순히 모델에 물리 상식이 부족해서가 아니라, 어텐션이 탐색 공간을 너무 일찍 좁히기 때문일 수 있다.
경량 수정과 영향
제안 방식은 디노이징 단계에 따라 RoPE 주파수를 조정한다. 생성 초반에는 공간 어텐션의 과도한 감쇠를 완화해 여러 움직임 후보를 더 오래 탐색하도록 한다. 생성이 진행되면 세부 묘사에 적합한 위치 제약을 다시 강화할 수 있다. 대규모 추가 학습에 의존하지 않는 경량 구조 변경이며, 학습 없는 방식과 학습 기반 방식 모두에 적용할 수 있다.
제공된 자료에 따르면 두 실험 설정에서 생성 영상의 물리적 상식과 일관성이 개선됐다. 이 결과는 비디오 생성 품질을 높이는 방법이 데이터 규모 확대나 외부 물리 사전지식에만 한정되지 않음을 보여준다. 모델이 언제 공간 가설을 확정하고, 어텐션이 이후 대안을 어떻게 차단하는지를 분석하는 것도 중요한 개선 방향이 될 수 있다.
다만 제공된 자료에는 전체 벤치마크 수치, 적용 모델의 범위, 물리 상황별 세부 비교가 포함되지 않았다. 다양한 아키텍처와 복잡한 움직임에서도 효과가 유지되는지는 추가 검증이 필요하다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…