아티클 목록으로
로보틱스·피지컬 AI

뇌파가 피지컬 AI의 다음 학습 데이터가 될 수 있을까

약 3분 소요

도입

대형 언어 모델은 인터넷의 방대한 텍스트를 바탕으로 성장했다. 하지만 로봇이 커피를 따르고, 서버 뒤편의 케이블을 꽂고, 젠가 블록을 무너뜨리지 않고 빼내는 법을 배우려면 훨씬 더 복잡한 데이터가 필요하다. TechCrunch 보도에 따르면 Encord는 캘리포니아 샌리앤드로의 창고에서 작업자가 실제 조작 과제를 수행하는 동안 카메라와 센서를 통해 데이터를 수집하고 있으며, 일부 실험에는 뇌파 측정도 포함된다.

핵심 포인트

  • 피지컬 AI의 병목은 데이터다. Encord는 로봇 기업들이 단순히 보유 데이터를 관리하는 수준을 넘어, 아직 존재하지 않는 훈련 데이터를 새로 만들어야 한다고 본다. 언어 모델용 텍스트와 달리 물리 조작 데이터는 작업 환경을 구성하고, 사람이 수행하고, 여러 센서로 기록한 뒤, 세밀하게 주석을 달아야 한다.

  • 뇌파 데이터는 아직 초기 검증 단계다. Encord는 독일 신경과학 스타트업 Zander Labs와 함께 뇌 활동을 이용해 의도, 오류, 놀람 같은 정신 상태를 추론할 수 있는지 시험하고 있다. 우선 뇌파가 태깅된 데이터셋을 만들고, 고객사의 로봇 모델에서 성능 개선이 있는지 평가한 뒤 확장 여부를 결정한다는 설명이다.

  • 1인칭 영상만으로는 부족하다. 로봇 기업들은 작업자가 착용한 카메라의 시점 영상과 원격 조작 로봇 데이터를 함께 활용하고 있다. Encord의 시설에서는 커피 따르기, 포커칩 쌓기, 서버의 이더넷 케이블 꽂고 빼기 같은 과제가 수행되며, 이는 정밀 조작이 여전히 어려운 문제임을 보여준다.

  • 정밀 주석은 가치와 비용을 동시에 높인다. Encord는 영상에 “오른손이 볼트를 조인다” 같은 물리적 설명을 붙여 LLM 기반 로봇 시스템이 행동을 이해하도록 돕는다. 특정 작업 학습에는 품질 낮은 1인칭 영상보다 훨씬 유용할 수 있지만, 제작 비용도 그만큼 커진다.

의미와 영향

이 사례는 생성형 AI와 체화형 AI의 경제학이 다르다는 점을 드러낸다. 텍스트는 대규모로 수집할 수 있지만, 로봇 학습 데이터는 카메라, 센서, 로봇 장비, 인간 작업자, 주석 인력이 결합된 생산 공정에 가깝다. 따라서 데이터 생성 자체가 연구 보조 수단을 넘어 하나의 사업 영역이 되고 있다.

뇌파가 실제 돌파구가 될지는 아직 확정되지 않았다. 사람이 망설이는 순간, 실수를 인식하는 순간, 높은 집중을 요구하는 구간을 데이터로 표시할 수 있다면 학습 샘플의 품질을 높일 가능성이 있다. 반대로 효과가 제한적이라면 업계는 영상, 원격 조작, 근전도, 행동 주석처럼 더 확장 가능한 방식에 집중할 것이다. 분명한 것은 로봇 AI 경쟁이 더 큰 모델을 만드는 문제에서, 현실 세계의 경험을 누가 더 체계적으로 생산하느냐의 문제로 넓어지고 있다는 점이다.

출처: TechCrunch AI

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
DriveZero: 인간 시연을 넘어 학습하는 자율주행
로보틱스·피지컬 AI
cctest.ai

DriveZero: 인간 시연을 넘어 학습하는 자율주행

DriveZero는 폐루프 강화학습과 비전 파운데이션 모델을 결합해 인간 주행 로그에만 의존하지 않는 엔드투엔드 자율주행을 시도한다. 지각과 행동을 별도로 학습한 뒤 증류를 통해 카메라 기반 플래너로 통합한다.

더 보기
CCTest · Blog
RoboTok, 인터넷 영상에서 손 동작이 비슷한 로봇 학습 데이터를 찾다
로보틱스·피지컬 AI
cctest.ai

RoboTok, 인터넷 영상에서 손 동작이 비슷한 로봇 학습 데이터를 찾다

RoboTok은 인간 조작 영상 한 편을 질의로 받아 인터넷에서 유사한 조작 시연 영상을 검색하는 데이터 엔진입니다. 행위자 중심의 3D 손 궤적을 활용해 시점, 가림, 장면이 달라도 조작 동작을 비교하는 것을 목표로 합니다.

더 보기
CCTest · Blog
Qwen-Drive-1.0: 비전언어 모델을 자율주행으로 확장하는 초기 시도
로보틱스·피지컬 AI
cctest.ai

Qwen-Drive-1.0: 비전언어 모델을 자율주행으로 확장하는 초기 시도

Qwen-Drive-1.0은 사전학습된 비전언어 모델을 유지하면서 3D 인식, 시각 질의응답, 모션 플래닝을 하나의 프레임워크에 통합하려는 연구입니다. BEV 인식 헤드와 플래닝 전문가를 통해 공유 표현을 검증 가능한 장면 구조와 미래 주행 궤적으로 연결합니다.

더 보기