TacForcing, 실행 중 촉각 피드백으로 로봇 동작을 업데이트하다
TacForcing은 로봇이 동작을 수행하는 동안 얻은 촉각 정보를 비전-언어-행동 모델에 반영하는 스트리밍 동작 생성 프레임워크다. 별도의 고주파 반응 제어기 없이 아직 실행되지 않은 동작을 계속 수정한다.
더 보기TacForcing은 로봇이 동작을 수행하는 동안 얻은 촉각 정보를 비전-언어-행동 모델에 반영하는 스트리밍 동작 생성 프레임워크다. 별도의 고주파 반응 제어기 없이 아직 실행되지 않은 동작을 계속 수정한다.
더 보기Zero-WAM은 인간의 조작 영상을 로봇의 작업 지시를 담은 컨텍스트로 사용해, 파라미터를 갱신하지 않고도 학습 단계에 없던 작업을 수행하도록 설계된 비디오-액션 모델입니다. 연구팀은 HumanGen 데이터셋과 IFP 학습 목표를 함께 제안했습니다.
더 보기Anthropic이 AI 에이전트가 로봇 팔, 현미경, 카메라, 실험 장비를 발견하고 제어할 수 있도록 설계한 ‘모델 하드웨어 표준(MHS)’ 연구 프리뷰를 공개했다. Claude에 하나의 고정된 몸을 부여하기보다, 연결된 장비를 필요에 따라 빌려 쓰는 접근이다.
더 보기StreamPI는 추가 파라미터 없이 단일 프레임 중심의 비전·언어·행동 모델에 시계열 추론을 더한다. 명령어 앵커 어텐션과 무작위 간격 학습을 통해 로봇이 과거 관찰을 활용하고 비동기 입력에도 대응하도록 설계됐다.
더 보기GigaBrain-0.7은 시각·언어 이해, 세계 예측, 로봇 행동을 연결하는 3시스템 구조를 제안한 구현 지능 모델입니다. 3만7,000시간이 넘는 이기종 데이터를 활용해 서로 다른 로봇 본체와 작업으로의 일반화를 노립니다.
더 보기WorldToken은 각 정책 시점의 다중 시점 이미지, 고유수용감각, 작업 조건을 하나의 월드 토큰으로 묶고 시간 순서로 모델링합니다. 실험은 목표 도메인 데이터와 긴 시간 문맥이 로봇 조작에 중요하다는 점을 보여줍니다.
더 보기PhysCaP는 코드-애즈-정책 로봇에 물리 정보 기반의 능동 탐색을 결합한 방법입니다. 로봇은 카메라 관찰에만 의존하지 않고 고유수용감각 데이터를 활용해 물체의 질량과 강성을 추정하며, 필요한 경우에만 추가 상호작용을 수행합니다.
더 보기General Intuition이 60억달러 프리머니 기업가치를 기준으로 신규 자금 조달을 협의하고 있다. 게임 플레이와 행동 데이터를 활용한 기반 모델을 로봇 분야로 확장한다는 구상이다.
더 보기τ₀-VLA는 장기 로봇 조작을 위해 세계 모델이 안내하는 테스트 시점 계산을 도입하고, 불확실한 상황에서 여러 하위 작업을 비교한 뒤 다음 행동을 결정합니다.
더 보기DeepMind가 VLM 기반 탐색, 모방 학습, 잔차 오프폴리시 강화학습을 결합한 VLA 정책 미세조정 방법 EXIMO를 제안했다. 이 방법은 새로운 작업을 학습할 때 필요한 원격조작 데이터와 시행착오를 줄이는 것을 목표로 한다.
더 보기지우스 인텔리전트와 위퉁이 적재량 4.2톤, 적재함 용적 19.32㎥의 자율주행 경트럭 Z20을 공개했다. 주요 적용처는 공장과 산업단지, 대형 물류센터 내부의 반복 운송이다.
더 보기Generalist의 GEN-1.5는 대규모 물리 상호작용 데이터로 사전 학습된 로봇 기초 모델입니다. 3~12초의 동작 시연만으로 파라미터 업데이트 없이 일부 미학습 작업에 도전합니다.
더 보기Zetta는 기반 정책을 고정한 상태에서 런타임 크리틱과 복구 스킬을 온라인으로 진화시키는 임바디드 AI 하네스입니다. 행동 수준 개입, 롤아웃 분석, 검증을 거친 업데이트를 서로 다른 시간尺度에서 결합합니다.
더 보기Ego2Robot은 1인칭 인간 조작 영상을 로봇용 학습 데이터로 바꾸는 합성 파이프라인이다. 소규모 태스크 변환을 넘어, 대규모 사전학습에 쓸 수 있는 데이터 자원을 만드는 데 초점을 둔다.
더 보기이 논문은 자율주행 VLM의 CoT 감독 학습에서 교사 모델이 정답 미래 궤적을 미리 보면, 실제 추론이 아니라 사후 합리화가 발생할 수 있다고 지적한다. AD-MCQ와 DEFT-RLVR는 주행 계획을 후보 궤적 선택 문제로 재구성한다.
더 보기N₀-TWAM은 접촉이 많은 로봇 조작을 위해 미래의 영상뿐 아니라 미래의 접촉까지 예측하는 촉각 네이티브 world-action model이다.
더 보기SGTP는 다중 차량 자율주행 레이싱에서 경쟁적 상호작용을 실시간으로 처리하기 위해 게임이론적 추론과 GPU 가속 샘플링 기반 계획을 결합한 프레임워크다.
더 보기새 논문은 군집 로봇을 위한 분산 예측 아키텍처 Collective-State JEPA를 제안한다. 각 로봇은 지역 관측과 제한된 이웃 메시지만으로 동일한 미래 집단 상태를 나타내는 표현을 만든다.
더 보기RL²-VLA는 비전-언어-행동 모델이 어려운 로봇 작업에서 실패할 가능성이 높을 때만 오프라인 강화학습 기반 조향을 적용하는 추론 시 프레임워크다.
더 보기N_0-VTLA는 시각과 언어만으로는 어려운 접촉 중심 조작 문제를 겨냥한 비전-촉각-언어-행동 모델입니다. 대규모 촉각 사전학습과 ALTER 기반 오프라인 정책 개선을 핵심으로 합니다.
더 보기WAIC 2026의 전시장은 로봇과 대형 모델로 뜨거웠지만, 핵심 질문은 더 현실적이었다. AI가 실제 업무와 산업 프로세스에 들어갔는가, 아니면 아직 데모에 머물러 있는가.
더 보기