화웨이 출신 AI 리더들, 로봇용 물리 파운데이션 모델에 도전
들어가며
대규모 언어 모델은 방대한 텍스트를 사전학습하면서 질의응답, 글쓰기, 코딩 등 여러 작업에 공통으로 활용되는 능력을 보여줬다. 반면 로봇 시스템은 여전히 특정 하드웨어와 환경, 작업에 맞춰 데이터를 수집하고 모델을 다시 조정하는 경우가 많다. 전 화웨이 클라우드 대규모 모델 책임자 리인과 전 화웨이 멀티모달 수석 과학자 장한왕이 공동 설립한 시랑카이우는 이 문제를 해결할 물리 세계용 기초 모델을 추진하고 있다. 회사가 붙인 이름은 LPM, 즉 Large Physics Model이다.
핵심 내용
- 투자와 조직: 회사는 시드 및 엔젤 라운드에서 수억 위안 규모의 투자를 유치했고, 기업가치는 약 5억 달러라고 설명했다. 조직은 모델, 데이터, 시스템 인프라 부문으로 구성된다.
- 해결하려는 문제: 화면에 무엇이 보이는지뿐 아니라 물체가 어떻게 움직이고, 행동이 환경을 어떻게 바꾸며, 결과가 어떤 인과관계에서 나왔는지를 학습하려 한다. 목표는 로봇 본체, 재질, 조명, 작업이 바뀌어도 지식이 이전되는 것이다.
- 데이터와 구조: 인터넷 물리 영상, 1인칭 데이터, 시연 데이터, 시뮬레이션, 공개 로봇 궤적, 실제 로봇 피드백을 활용할 계획이다. 핵심 구조는 통합 자기회귀 Transformer이며, 연속적인 미래 상태나 영상 생성에는 확산 모듈을 선택적으로 사용한다.
- 능력 단계: L0는 범용 물리 기초 모델, L1은 산업 등 분야별 모델, L2는 구체적인 로봇 작업에 적용되는 단계다.
왜 물리 기초 모델인가
물리 지능은 계속 변하는 환경에서 연속적으로 판단해야 한다. 책상을 정리하는 일만 해도 물체를 인식하고 순서를 정하며 이동 경로를 계획하고, 각 행동 이후 달라진 상황에 맞춰 전략을 수정해야 한다. 결정 단계가 길어질수록 가능한 행동 조합은 빠르게 늘어나며, 특정 작업의 시연 데이터만으로는 모든 경우를 다루기 어렵다.
시랑카이우의 접근법은 현재 상태, 행동, 다음 상태를 하나의 예측 과정으로 연결하는 것이다. 가능한 미래를 모두 미리 열거하는 대신 현재 상태에서 행동을 선택하고, 결과를 관찰한 뒤 갱신된 상태에서 다음 결정을 내린다. 통합 토큰, 강화학습, 데이터 파이프라인, 평가 체계와 대규모 시스템 인프라를 하나의 학습 순환에 넣는 구상이다.
의미와 과제
이 접근법의 산업적 의미는 로봇 개발을 ‘배치할 때마다 재학습’하는 방식에서, 이미 학습한 물리 지식을 여러 작업에 재사용하는 방식으로 바꾸려는 데 있다. 물리 지능에도 언어 모델과 유사한 스케일링 효과가 있다면 데이터와 모델 규모를 키우면서 일반화 성능을 높일 가능성이 있다. 회사는 World Arena 2.0의 관련 트랙에서 궤적 정확도 1위, 물리적 일관성 2위를 기록했으며, 데이터와 학습 규모 확대에 따라 초기 성능 향상이 나타났다고 밝혔다. 다만 이는 회사가 공개한 정보이므로 독립적인 검증이 필요하다.
영상에서 발견한 통계적 상관관계가 곧바로 인과적이고 실행 가능한 지식이 되는 것은 아니다. 시뮬레이션과 실제 하드웨어 사이의 차이, 장기 계획, 데이터 품질, 학습 비용, 안전성, 로봇 본체 간 일반화가 성패를 좌우할 전망이다. 예정된 XIRRA v0.1 공개는 이 접근법을 판단할 초기 기준점이 될 수 있다.
출처: 퀀텀비트
댓글
로그인 상태 확인 중…
댓글 불러오는 중…