EXIMO: VLM 계획으로 VLA 로봇 정책을 효율적으로 적응시키다
DeepMind가 VLM 기반 탐색, 모방 학습, 잔차 오프폴리시 강화학습을 결합한 VLA 정책 미세조정 방법 EXIMO를 제안했다. 이 방법은 새로운 작업을 학습할 때 필요한 원격조작 데이터와 시행착오를 줄이는 것을 목표로 한다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 775개의 아티클
DeepMind가 VLM 기반 탐색, 모방 학습, 잔차 오프폴리시 강화학습을 결합한 VLA 정책 미세조정 방법 EXIMO를 제안했다. 이 방법은 새로운 작업을 학습할 때 필요한 원격조작 데이터와 시행착오를 줄이는 것을 목표로 한다.
더 보기새 연구는 추론 시 검색된 문서를 제공하지 않아도 고정된 문서 모음에 답할 수 있도록 하는 IAR 후학습 프레임워크를 제안했다. 문서 지식 주입, QA 행동 정렬, 일반 능력 회복을 분리해 다루는 것이 핵심이다.
더 보기NARU는 일본어 장편 영상에서 변화하는 서사를 추적하고 명시되지 않은 문화적 의미를 추론하는 능력을 함께 평가하는 벤치마크다. 평가 결과, 현행 멀티모달 모델은 장거리 정보 통합과 문화적 맥락 기반 추론에서 여전히 큰 어려움을 보였다.
더 보기새 연구는 이전 시도의 흔적과 피드백을 축적해 다음 답변을 수정하는 ‘Chain-of-Experience(CoE)’를 제안했다. 수학, 코딩, 지식 과제에서 자기 피드백과 환경 신호가 언어 모델의 지속적 개선에 미치는 영향을 평가했다.
더 보기코딩 에이전트의 성공 여부는 모델이 어떤 명령을 생성했는지뿐 아니라, 실행 전에 그 명령이 어떻게 직렬화되고 포장되며 다시 파싱되는지에도 좌우됩니다. QuoteBench는 단일 매칭 점수가 인터페이스에서 발생한 실패를 가릴 수 있음을 측정했습니다.
더 보기링크드인은 7월 30일 도입한 ‘AI 슬롭처럼 보임’ 피드백 기능을 100만 명 이상이 클릭했다고 밝혔습니다. 회사는 AI 슬롭으로 분류한 게시물의 조회수가 몇 주 전보다 40% 감소했다고도 설명했습니다.
더 보기Nvidia 연구진은 모델 자체를 바꾸지 않고도 주변 소프트웨어 계층을 조정해 장기 과제 성능을 크게 높였습니다. 기억 관리, 도구 사용, 감독 에이전트가 에이전트 시스템의 핵심 요소로 떠오르고 있습니다.
더 보기DeepSeek가 API 플랫폼에 deepseek-v4-flash-vision-exp를 출시하며 V4 시리즈에 공식 이미지 입력 기능을 추가했다. 도구 사용과 코딩 에이전트 관련 평가에서도 여러 지표가 개선됐다.
더 보기Meta AI Research가 Apache 2.0 라이선스의 오픈 웨이트 모델 Muse Glimmer를 공개했습니다. 이 모델은 로컬 환경에서 비전 입력, 코딩, 다단계 도구 호출과 오류 복구를 수행하도록 설계됐습니다.
더 보기AI 영상 경쟁의 기준이 인상적인 한 장면을 만드는 능력에서 브리프를 이해하고 여러 버전을 일관된 과정으로 납품하는 능력으로 이동하고 있다.
더 보기지우스 인텔리전트와 위퉁이 적재량 4.2톤, 적재함 용적 19.32㎥의 자율주행 경트럭 Z20을 공개했다. 주요 적용처는 공장과 산업단지, 대형 물류센터 내부의 반복 운송이다.
더 보기OpenConnector는 AI 에이전트와 애플리케이션 개발자를 위한 오픈소스 커넥터 게이트웨이입니다. SaaS 인증, 권한 관리, API 변환, 실행 감사를 하나의 런타임에서 다루는 것을 목표로 합니다.
더 보기Meta의 카메라 탑재 AI 안경이 대중화되면서 주변 사람들이 모르는 사이 촬영될 위험에 대한 우려가 커지고 있다. 탐지 앱은 단서를 제공하지만 실제 녹화 여부까지 확인하지는 못한다.
더 보기Anthropic은 과거 141006회의 평가 실행을 감사한 결과, 격리된 것으로 알려진 환경에서 모델이 공용 인터넷에 접근한 세 가지 사건을 확인했다. 핵심 원인은 단일 모델의 통제 실패보다 이그레스 제어와 모니터링, 평가 환경 설계의 결함이었다.
더 보기DeepSeek가 V4-Flash에 시각 기능을 더한 실험 버전 DeepSeek-V4-Flash-Vision-Exp를 공개했습니다. 지정된 모델 ID로 API에서 이용할 수 있으며, 기존 텍스트 능력을 유지하면서 이미지 이해를 강화하는 것이 핵심입니다.
더 보기Generalist의 GEN-1.5는 대규모 물리 상호작용 데이터로 사전 학습된 로봇 기초 모델입니다. 3~12초의 동작 시연만으로 파라미터 업데이트 없이 일부 미학습 작업에 도전합니다.
더 보기4DAnyone은 보정되지 않은 단안 인물 영상에서 시점 간 일관성이 높은 다중 시점 영상을 생성한 뒤 이를 4D Gaussian Splatting으로 변환합니다. 늘어나는 참조 정보와 분할된 시점 그룹 사이의 구조적 불일치를 두 가지 컨텍스트 설계로 해결하려 합니다.
더 보기공개 베타 시작 일주일 만에 DeepSeek Harness가 v0.1.0-rc.8을 공개했다. 네이티브 이미지 요청과 텍스트·이미지 혼합 입력을 지원하며, 서브 에이전트 연동과 Windows용 영구 PowerShell 세션도 강화했다.
더 보기주요 AI 연구소와 기업의 고품질 학습 데이터 수요가 데이터 라벨링 스타트업의 성장을 가속하고 있다. 설립 약 4년 된 Micro1은 8개월 만에 총 연환산 매출을 1억 달러에서 5억 달러로 끌어올린 것으로 전해졌다.
더 보기Bounded Agents는 위임된 권한과 예산, 이전 행동을 추적하는 Agentic Principal Chain(APC)을 제안합니다. 모델 자체가 아니라 외부 인가 계층에서 행동 조합과 권한 범위를 검증해 멀티 에이전트 보안 위험을 줄입니다.
더 보기호환 가능한 언어 모델 체크포인트가 가중치만으로 공통 조상을 드러낼 수 있는지를 검증한 연구가 나왔다. 잔차 구조에서 오해를 부를 수 있는 공유 성분을 제거하고 체크포인트 고유 구조를 비교하는 방식이다.
더 보기