아티클 & 가이드

월드 모델

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 38개의 아티클

CCTest · Blog
NVIDIA Cosmos-H-Dreams, 수술 로봇 세계 모델을 실시간 상호작용으로 확장
월드 모델
cctest.ai
월드 모델

NVIDIA Cosmos-H-Dreams, 수술 로봇 세계 모델을 실시간 상호작용으로 확장

NVIDIA가 수술 로봇용 실시간 액션 조건부 생성 시뮬레이터 Cosmos-H-Dreams를 소개했다. 이 시스템은 Cosmos-H-Surgical-Simulator를 인과적 소수 단계 학생 모델로 증류하고 FlashDreams로 스트리밍 추론한다.

더 보기
CCTest · Blog
UniWorld-View, WorldScore 1위: 이미지 한 장으로 제어 가능한 새 시점 영상을 만든다
월드 모델
cctest.ai
월드 모델

UniWorld-View, WorldScore 1위: 이미지 한 장으로 제어 가능한 새 시점 영상을 만든다

투잔 인텔리전스가 베이징대, 펑청연구소와 개발한 UniWorld-View가 페이페이 리 팀 관련 WorldScore 순위에서 1위에 올랐다. 단일 이미지나 단안 영상에서 지정한 카메라 궤적의 새 시점 영상을 생성하는 것이 핵심이다.

더 보기
CCTest · Blog
ABot-World-0: 데스크톱 GPU 한 장으로 실행하는 실시간 인터랙티브 월드 모델
월드 모델
cctest.ai
월드 모델

ABot-World-0: 데스크톱 GPU 한 장으로 실행하는 실시간 인터랙티브 월드 모델

ABot-World-0는 비디오 생성을 사용자의 행동에 반응하는 월드 모델로 확장하려는 시도다. 다중 데이터 인프라, 장기 롤아웃 증류, 스트리밍 추론 최적화를 결합해 단일 RTX 5090에서 720P 실시간 생성을 보고했다.

더 보기
CCTest · Blog
Masked Visual Actions: 비디오 모델을 로봇 세계 모델로 연결하는 방법
월드 모델
cctest.ai
월드 모델

Masked Visual Actions: 비디오 모델을 로봇 세계 모델로 연결하는 방법

Masked Visual Actions는 행동을 영상 속 일부가 드러난 픽셀 궤적으로 표현하는 제어 인터페이스다. 로봇 움직임을 보여주면 장면 반응을 예측하고, 원하는 물체 움직임을 보여주면 그 결과에 맞는 로봇 동작을 합성한다.

더 보기
CCTest · Blog
AlayaRenderer-Flash, 생성형 월드 렌더링을 플레이 가능한 30 FPS로 끌어올리다
월드 모델
cctest.ai
월드 모델

AlayaRenderer-Flash, 생성형 월드 렌더링을 플레이 가능한 30 FPS로 끌어올리다

AlayaRenderer-Flash는 생성형 월드 렌더링 속도를 0.56 FPS에서 31.54 FPS로 높여, 물리 엔진 기반 인터랙티브 장면을 실시간 플레이에 가깝게 만들었다. 텍스트만으로 영상을 상상하는 방식이 아니라, 구조화된 월드 상태를 바탕으로 RGB 프레임을 합성한다.

더 보기
CCTest · Blog
마스크드 확산 언어모델, Agent RL을 위한 텍스트 월드 모델로 부상
월드 모델
cctest.ai
월드 모델

마스크드 확산 언어모델, Agent RL을 위한 텍스트 월드 모델로 부상

이 논문은 Masked Diffusion Language Models가 텍스트 기반 월드 모델에서 자기회귀 모델의 좌에서 우로 생성 편향을 줄일 수 있다고 주장한다. 양방향 denoising을 통해 도구 스키마, 이전 턴, 도메인 규칙, 기대 결과 같은 전역 앵커와 더 잘 맞춘다는 설명이다.

더 보기
CCTest · Blog
DSWorld: 데이터 과학 에이전트가 실행 전에 결과를 예측하는 세계 모델
월드 모델
cctest.ai
월드 모델

DSWorld: 데이터 과학 에이전트가 실행 전에 결과를 예측하는 세계 모델

DSWorld는 자율 데이터 과학 에이전트에 세계 모델 개념을 적용해, 비용이 큰 실행 전에 작업 결과를 예측한다. 논문은 강화학습 기반 학습을 약 14배, 검색 기반 추론을 약 3~6배 빠르게 했다고 보고한다.

더 보기
CCTest · Blog
픽셀에서 상태로: 인터랙티브 월드 모델은 왜 아직 게임 엔진이 아닌가
월드 모델
cctest.ai
월드 모델

픽셀에서 상태로: 인터랙티브 월드 모델은 왜 아직 게임 엔진이 아닌가

새 arXiv 논문은 생성형 게임 엔진 논의를 전통적인 게임 루프인 행동, 상태, 관측의 관점에서 다시 정리한다. 핵심은 그럴듯한 영상 생성이 아니라 규칙을 따르고 결과를 기억하는 상태 기반 세계다.

더 보기
CCTest · Blog
M⁴World: 자율주행 시뮬레이션을 위한 다중 시점·멀티모달 월드 모델
월드 모델
cctest.ai
월드 모델

M⁴World: 자율주행 시뮬레이션을 위한 다중 시점·멀티모달 월드 모델

arXiv 논문 M⁴World는 주변 시점 비디오와 동기화된 LiDAR를 생성하면서 객체 단위 조작을 지원하는 주행 월드 모델을 제안합니다. 핵심은 제어 가능성, 장시간 안정성, 희귀 주행 상황 맞춤 생성입니다.

더 보기