아티클 목록으로
월드 모델

Zing-0.5, 텍스트와 키보드로 조작하는 생성 세계

약 3분 소요

생성형 비디오 모델은 장면을 만들어 보여주는 데는 강하지만, 사용자가 그 세계를 이동하고 도중에 명령을 내리며 결과에 다시 반응하는 경험을 만들기는 어렵습니다. Zing-0.5는 생성된 세계를 단순히 시청하는 것이 아니라 직접 탐험하고 조작할 수 있도록 설계된 50억 파라미터 자기회귀 세계 모델입니다.

핵심 내용

  • 키보드와 텍스트의 통합 제어: 모델은 입력 강도를 반영한 키보드 조작, 시간적으로 정렬된 텍스트 지시, 공동 주석 영상 데이터를 하나의 시퀀스에서 학습합니다. 키보드로 이동하면서 텍스트로 진행 중인 이벤트를 바꾸는 방식입니다.
  • 이벤트 단위 감독: 여러 프롬프트로 연결된 영상을 사용해 세그먼트 수준의 교사 모델을 학습한 뒤, 블록 단위 인과 학생 모델에 분포 매칭 증류를 적용합니다. 개별 프레임의 품질만이 아니라 사건이 이어지는 흐름을 유지하는 것이 목표입니다.
  • 실시간·저비용 상호작용: 4단계 생성과 문맥 보존 스트리밍을 결합해 832×480 해상도에서 24 FPS 추론을 지원합니다. 논문은 스트림 1분당 약 0.009달러의 서버 임대 비용을 추정합니다.

평가와 시연

Zing-0.5는 158개 WBench Navigation 사례에서 총점 81.0, 일관성 점수 88.5를 기록했습니다. 공동 제어 시연에서는 사용자가 계속 이동하는 동안 텍스트 명령으로 특정 이벤트를 변경합니다. 생성 과정을 다시 시작하지 않고 이어갈 수 있다는 점은 텍스트가 초기 장면 설명을 넘어 실행 중 제어 신호로 사용된다는 것을 보여줍니다.

의미와 한계

이 모델의 핵심 의미는 세계 생성과 세계 조작을 하나의 자기회귀 루프 안에서 다루려는 데 있습니다. 게임 프로토타이핑, 탐험형 스토리, 체화형 에이전트 연구에서는 키보드와 자연어를 함께 쓰는 인터페이스가 단일 행동 입력보다 유연할 수 있습니다. 또한 이벤트 단위 감독은 세계 모델을 평가할 때 한 프레임의 그럴듯함뿐 아니라 시간에 따른 사건의 연속성도 봐야 한다는 방향을 제시합니다.

다만 제공된 자료에는 전체 학습 데이터, 장시간 생성에서의 실패 사례, 하드웨어별 성능 비교가 포함되어 있지 않습니다. 따라서 Zing-0.5를 장기 일관성과 복잡한 세계 규칙을 완전히 해결한 모델로 보기보다는, 플레이 가능한 생성 세계를 탐색하는 공개 연구로 이해하는 편이 정확합니다. 모델 가중치, 추론 코드, Zing-SGLang 서빙 구현의 공개는 후속 재현과 비교를 위한 기반을 제공합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Pelican-Sim 1.0, 로봇을 위한 범용 월드 모델 시뮬레이터
월드 모델
cctest.ai
월드 모델

Pelican-Sim 1.0, 로봇을 위한 범용 월드 모델 시뮬레이터

Pelican-Sim 1.0은 시각적 맥락과 로봇 행동을 바탕으로 미래 관측을 예측하는 체화 지능용 범용 시뮬레이터입니다. 통합 행동 공간, 행동-영상 주입, 희소 MoE, 단축 롤아웃을 통해 이기종 로봇의 제어 가능성과 생성 효율을 높였습니다.

더 보기
CCTest · Blog
World in World, 동결된 비디오 월드 모델에 유연한 제어를 더하다
월드 모델
cctest.ai
월드 모델

World in World, 동결된 비디오 월드 모델에 유연한 제어를 더하다

World in World는 비디오 월드 모델을 다시 학습하지 않고도 여러 시각적 증거를 추론 단계에서 통합하는 인터페이스를 제안한다. 시점 변경, 장기 재방문, 인간 동작 전이를 하나의 구조로 지원하는 것이 목표다.

더 보기
CCTest · Blog
한 장의 이미지에서 실행 가능한 세계로: RCWM의 재귀적 3D 장면 구축
월드 모델
cctest.ai
월드 모델

한 장의 이미지에서 실행 가능한 세계로: RCWM의 재귀적 3D 장면 구축

Recursive Code World Models(RCWM)는 단일 참조 이미지에서 복잡한 3D 세계를 실행 가능한 코드로 재구성하는 프레임워크입니다. 전체·부분·전체의 재귀 루프를 통해 세부를 다듬으면서도 장면 전체의 공간 관계를 유지합니다.

더 보기