아티클 목록으로
월드 모델

NVIDIA Cosmos 3 Edge 공개: 세계 모델을 엣지 로봇으로

약 3분 소요

도입

NVIDIA가 Cosmos 3 Edge를 Hugging Face의 Cosmos 3 저장소에 공개했다. 핵심 목표는 물리 AI 시스템을 데이터센터 밖으로 더 가까이 이동시키는 것이다. 공장, 창고, 병원 같은 실제 환경에서 로봇과 비전 AI 에이전트는 주변 상황을 이해하고, 다음에 어떤 변화가 일어날지 예측하며, 어떤 행동을 취해야 하는지 판단해야 한다.

Cosmos 3 Edge는 40억 파라미터 규모의 오픈 월드 모델이다. NVIDIA의 설명에 따르면 이 모델은 단순히 크기를 키우는 대신, 메모리가 제한된 엣지 장치에서 높은 처리량의 추론을 제공하도록 설계됐다. 소형 비전-언어 모델로 시각 분석과 추론에 사용할 수 있고, 후학습을 통해 로봇 제어용 세계 행동 모델로도 활용할 수 있다.

핵심 내용

  • 엣지 배포를 위한 세계 모델: 모델은 NVIDIA RTX PRO, DGX, GeForce RTX, Jetson 등 다양한 NVIDIA 플랫폼에서의 실행을 염두에 두고 있다. 센서와 액추에이터에 더 가까운 위치에서 추론하는 것이 중요한 방향이다.
  • 이해, 예측, 행동의 통합: 세계 모델은 현재 장면을 표현하는 데 그치지 않고, 가능한 미래를 시뮬레이션하며, 행동이 환경에 미칠 영향을 다뤄야 한다. Cosmos 3 Edge는 이를 공유 표현 안에 연결하려 한다.
  • 두 개의 Transformer 타워: 자기회귀 타워는 시각 및 텍스트 token을 처리해 이해와 추론을 담당한다. 확산 타워는 시각, 오디오, 행동 token을 다루며 예측, 생성, 신경 시뮬레이션에 쓰인다. 두 타워는 정규화 계층과 MLP는 분리하지만 멀티모달 어텐션 계층은 공유한다.
  • 공통 행동 표현: 차량, 카메라, 로봇 팔, 그리퍼는 행동을 서로 다르게 표현한다. Cosmos 3는 이동, 회전, 조작 상태를 포함하는 압축된 기하 벡터로 행동을 인코딩해 시각 변화와 물리적 제어를 연결한다.
  • 로봇 정책 모델로 활용: 정책 모드에서 모델은 다음 행동과 그 행동이 가져올 시각적 결과를 함께 예측할 수 있다. NVIDIA는 DROID 데이터셋으로 후학습한 pick-and-place용 Cosmos 3 Edge Policy도 함께 공개했다.
  • 후학습 및 증류 경로 제공: 기본 모델 외에도 참조 checkpoint와 학습 스크립트가 제공된다. 또한 Cosmos 3 Super 4-Step Distillation checkpoint는 확산 denoising 단계를 4단계로 줄여 이미지 및 비디오 생성 속도를 높이는 예시로 제시됐다.

의미와 영향

Cosmos 3 Edge의 의미는 단순히 멀티모달 모델이라는 데 있지 않다. 지각, 시간적 예측, 제어를 하나의 흐름으로 묶고, 이를 온디바이스 배포에 더 적합한 형태로 만들려는 시도라는 점이 중요하다. 물리 AI에서 엣지 추론은 지연 시간을 줄이고 반응성을 높이며, 지속적인 클라우드 연결 의존도를 낮출 수 있다.

이 모델은 로보틱스 AI의 변화도 보여준다. 로봇은 물체를 인식하거나 장면을 설명하는 것만으로 충분하지 않다. 접촉, 움직임, 공간 관계, 그리고 자신의 행동이 환경에 미치는 결과를 함께 이해해야 한다. Cosmos 3 Edge는 언어, 비디오, 오디오, 행동을 공유 어텐션으로 연결해 이러한 관계를 하나의 내부 표현으로 다루려 한다.

다만 이번 정보는 NVIDIA 공식 블로그에서 나온 것이므로 발표와 홍보의 성격이 강하다. 실제 성능은 후학습 데이터 품질, 선택한 하드웨어, 제어 루프 통합, 실제 배치 환경에서의 견고성에 따라 달라질 것이다. 그럼에도 Hugging Face에서 접근 가능한 오픈 출발점이라는 점에서, 로보틱스와 스마트 인프라, 비전 AI용 도메인 특화 세계 모델을 구축하려는 개발자에게 의미 있는 공개다.

출처: Hugging Face Blog

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
DSWorld: 데이터 과학 에이전트가 실행 전에 결과를 예측하는 세계 모델
월드 모델
cctest.ai
월드 모델

DSWorld: 데이터 과학 에이전트가 실행 전에 결과를 예측하는 세계 모델

DSWorld는 자율 데이터 과학 에이전트에 세계 모델 개념을 적용해, 비용이 큰 실행 전에 작업 결과를 예측한다. 논문은 강화학습 기반 학습을 약 14배, 검색 기반 추론을 약 3~6배 빠르게 했다고 보고한다.

더 보기
CCTest · Blog
픽셀에서 상태로: 인터랙티브 월드 모델은 왜 아직 게임 엔진이 아닌가
월드 모델
cctest.ai
월드 모델

픽셀에서 상태로: 인터랙티브 월드 모델은 왜 아직 게임 엔진이 아닌가

새 arXiv 논문은 생성형 게임 엔진 논의를 전통적인 게임 루프인 행동, 상태, 관측의 관점에서 다시 정리한다. 핵심은 그럴듯한 영상 생성이 아니라 규칙을 따르고 결과를 기억하는 상태 기반 세계다.

더 보기