PhiZero: ‘물리 언어’로 세계 모델을 다시 설계하다
PhiZero는 세계 상태의 변화를 압축된 이산 표현인 ‘물리 언어’로 다루는 물리 세계 모델이다. 미래 영상을 픽셀 공간에서 바로 예측하는 대신, 먼저 변화 과정을 추론한 뒤 이를 영상으로 렌더링한다.
더 보기PhiZero는 세계 상태의 변화를 압축된 이산 표현인 ‘물리 언어’로 다루는 물리 세계 모델이다. 미래 영상을 픽셀 공간에서 바로 예측하는 대신, 먼저 변화 과정을 추론한 뒤 이를 영상으로 렌더링한다.
더 보기페이페이 리가 이끄는 World Labs가 현실 로봇 작업을 시뮬레이션으로 옮기고, 그 안에서 정책을 훈련·평가한 뒤 실제 하드웨어에 배포하는 R2S2R 엔진을 공개했다.
더 보기Wonder는 비디오 생성을 고정된 클립 제작이 아니라, 사용자가 카메라를 움직이며 탐험할 수 있는 시각적 세계 생성 문제로 확장합니다.
더 보기NVIDIA가 수술 로봇용 실시간 액션 조건부 생성 시뮬레이터 Cosmos-H-Dreams를 소개했다. 이 시스템은 Cosmos-H-Surgical-Simulator를 인과적 소수 단계 학생 모델로 증류하고 FlashDreams로 스트리밍 추론한다.
더 보기WorldWeaver는 스트리밍 자기회귀 확산 비디오 모델에 세계 상태 레지스터를 도입해, 여러 에이전트와 시점 사이에서 동일한 환경 상태를 유지하려는 접근이다.
더 보기투잔 인텔리전스가 베이징대, 펑청연구소와 개발한 UniWorld-View가 페이페이 리 팀 관련 WorldScore 순위에서 1위에 올랐다. 단일 이미지나 단안 영상에서 지정한 카메라 궤적의 새 시점 영상을 생성하는 것이 핵심이다.
더 보기AlayaWorld는 텍스트, 이미지, 비디오 입력을 바탕으로 탐색 가능한 가상 환경을 생성하려는 비디오 월드 모델이다. 핵심은 짧은 영상 생성이 아니라 상호작용, 장기 일관성, 효율적인 응답을 함께 달성하는 데 있다.
더 보기ABot-World-0는 비디오 생성을 사용자의 행동에 반응하는 월드 모델로 확장하려는 시도다. 다중 데이터 인프라, 장기 롤아웃 증류, 스트리밍 추론 최적화를 결합해 단일 RTX 5090에서 720P 실시간 생성을 보고했다.
더 보기Masked Visual Actions는 행동을 영상 속 일부가 드러난 픽셀 궤적으로 표현하는 제어 인터페이스다. 로봇 움직임을 보여주면 장면 반응을 예측하고, 원하는 물체 움직임을 보여주면 그 결과에 맞는 로봇 동작을 합성한다.
더 보기AlayaRenderer-Flash는 생성형 월드 렌더링 속도를 0.56 FPS에서 31.54 FPS로 높여, 물리 엔진 기반 인터랙티브 장면을 실시간 플레이에 가깝게 만들었다. 텍스트만으로 영상을 상상하는 방식이 아니라, 구조화된 월드 상태를 바탕으로 RGB 프레임을 합성한다.
더 보기EvolvingWorld는 단순한 대사 생성이 아니라, 이야기가 진행될수록 인물과 세계 상태가 함께 갱신되는 구조를 제안한다. 정적인 페르소나 모방을 넘어 장기 일관성을 다루려는 시도다.
더 보기이 논문은 Masked Diffusion Language Models가 텍스트 기반 월드 모델에서 자기회귀 모델의 좌에서 우로 생성 편향을 줄일 수 있다고 주장한다. 양방향 denoising을 통해 도구 스키마, 이전 턴, 도메인 규칙, 기대 결과 같은 전역 앵커와 더 잘 맞춘다는 설명이다.
더 보기NVIDIA가 Hugging Face에 로봇과 비전 AI를 위한 40억 파라미터 오픈 월드 모델 Cosmos 3 Edge를 공개했다. 이 모델은 엣지 장치에서 장면 이해, 미래 예측, 시뮬레이션, 행동 생성을 연결하는 것을 목표로 한다.
더 보기DSWorld는 자율 데이터 과학 에이전트에 세계 모델 개념을 적용해, 비용이 큰 실행 전에 작업 결과를 예측한다. 논문은 강화학습 기반 학습을 약 14배, 검색 기반 추론을 약 3~6배 빠르게 했다고 보고한다.
더 보기UniVR은 이미지-텍스트 쌍이 아니라 순수한 시각 데모만으로 복잡한 추론, 세밀한 물리 동역학, 장기 계획을 학습하려는 연구다. 핵심은 VR-GRPO 강화학습 방식과 순수 시각 평가용 VR-X 벤치마크다.
더 보기새 arXiv 논문은 생성형 게임 엔진 논의를 전통적인 게임 루프인 행동, 상태, 관측의 관점에서 다시 정리한다. 핵심은 그럴듯한 영상 생성이 아니라 규칙을 따르고 결과를 기억하는 상태 기반 세계다.
더 보기arXiv 논문 M⁴World는 주변 시점 비디오와 동기화된 LiDAR를 생성하면서 객체 단위 조작을 지원하는 주행 월드 모델을 제안합니다. 핵심은 제어 가능성, 장시간 안정성, 희귀 주행 상황 맞춤 생성입니다.
더 보기