GigaBrain-0.7, 3시스템 구조로 구현 지능의 일반화 확장
GigaBrain-0.7은 시각·언어 이해, 세계 예측, 로봇 행동을 연결하는 3시스템 구조를 제안한 구현 지능 모델입니다. 3만7,000시간이 넘는 이기종 데이터를 활용해 서로 다른 로봇 본체와 작업으로의 일반화를 노립니다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 775개의 아티클
GigaBrain-0.7은 시각·언어 이해, 세계 예측, 로봇 행동을 연결하는 3시스템 구조를 제안한 구현 지능 모델입니다. 3만7,000시간이 넘는 이기종 데이터를 활용해 서로 다른 로봇 본체와 작업으로의 일반화를 노립니다.
더 보기AutoSaddler는 LLM 에이전트 하네스 최적화를 오프라인 학습 문제로 다룹니다. 실행 궤적을 진단하고 구조화된 패치를 생성한 뒤, 검증을 거쳐 일반화 가능성이 높은 업데이트를 선택합니다.
더 보기CyberFactory는 공개 취약점 자료를 실행 가능한 과제로 재구성하고, 도구 사용과 실행 결과를 통해 에이전트의 작업 궤적을 검증하는 오픈소스 프레임워크입니다. 이 데이터로 학습한 OpenAegis는 보고된 CyberGym 평가에서 58.1%의 Pass@1을 기록했습니다.
더 보기SecOPD는 응답 전체가 아닌 토큰별 피드백을 사용하는 방어적 미세조정 기법입니다. 논문은 방어된 Qwen3.6-27B가 PISmith 공격 성공률을 94.0%에서 9.0%로 낮췄다고 보고합니다.
더 보기LAION-BVD는 웹에서 수집한 동영상 URL을 바탕으로 약 8천만 개의 영상과 총 1천만 시간 분량을 제공하는 공개 데이터셋입니다. 장면 분할, 합성 캡션, 장면 전환 프레임 추출을 통해 영상·음성·이미지 사전학습을 지원합니다.
더 보기새로운 서베이는 스마트 안경을 단순한 카메라나 디스플레이가 아니라 1인칭 지능 플랫폼으로 재정의한다. 핵심은 인식부터 행동까지의 고리를 실제 제약 속에서도 신뢰성 있고 교정 가능하게 유지하는 데 있다.
더 보기Station은 서로 다른 모델 계열의 AI 에이전트가 고정된 연구 절차나 중앙 조정자 없이 수학 문제를 함께 탐구하는 오픈월드 환경이다. 논문은 여러 구성 문제에서 기존 문헌 대비 새로운 결과를 보고하고, 대화 기록과 증명, 검증 코드도 공개했다.
더 보기로봇용 AI 파운데이션 모델을 개발하는 제너럴리스트가 8VC가 주도한 추가 자금 조달을 통해 기업가치 30억 달러에 도달한 것으로 전해졌다. 이번 약 2억 달러 규모의 투자는 지난 6월 발표한 4억 달러 시리즈 B의 연장 라운드다.
더 보기OpenAI의 전 데이터센터 책임자 크리스 말론이 인프라 조직 개편 이후 회사를 떠났다. 올해 주요 임원들의 연이은 이탈과 맞물리면서 데이터센터 확장 실행력과 조직 안정성, 향후 상장 준비에 대한 관심이 커지고 있다.
더 보기EchoWM은 사용자가 장면 안으로 들어가 지속적으로 이동할 수 있는 생성 미디어용 옴니모달 월드 모델입니다. 이동에 맞춰 720p 영상, 환경음, 음악, 음성을 함께 생성합니다.
더 보기Prime Agent는 장기 과제 평가와 코딩 에이전트 워크플로를 위한 오픈소스 하네스입니다. 지속형 REPL, 궤적 간 메모리, 재귀적 하위 에이전트, 복구 기능을 결합해 모델의 한계와 인프라 오류를 구분합니다.
더 보기MobilePA-Bench는 단순한 화면 조작을 넘어 도구 호출, 장기 계획, 메모리, 복합 스킬, 서브에이전트 협업을 평가하는 인터랙티브 벤치마크입니다. 엄격한 도구 순서와 권한 제한, 실행 중 오류가 발생하면 최신 LLM의 신뢰성이 크게 떨어지는 것으로 나타났습니다.
더 보기Thinkingbox는 그럴듯한 답변이나 올바른 도구 호출을 넘어, 업무 흐름이 끝난 뒤 백엔드 상태가 요구사항과 일치하는지 검증합니다. 벤치마크 결과는 우연한 성공과 반복 가능한 실행 능력 사이에 큰 차이가 있음을 보여줍니다.
더 보기GameXpert-Bench는 코딩 에이전트의 게임 개발 능력을 생성, 버그 수정, 다중 턴 최적화의 전체 과정에서 평가한다. 에이전트는 플레이 가능한 기반을 만드는 데는 강하지만, 능동적인 결함 발견과 런타임 검증, 회귀 방지에는 여전히 약점을 보인다.
더 보기음성 기반 멀티홉 질의응답에서 더 풍부한 검색 구조가 절대 성능은 높이지만, 상류 음성인식 오류에는 오히려 더 취약할 수 있다는 연구 결과가 나왔다. 특히 질의 속 엔터티가 잘못 인식되는 현상이 오류 전파의 핵심 원인으로 나타났다.
더 보기TileMix는 융합된 밀집 어텐션 커널 안에서 스코어 타일 그룹을 FP16 또는 INT8 경로로 나눕니다. 토큰 연결을 제거하지 않으면서 긴 컨텍스트 프리필의 품질과 처리량 사이의 균형을 겨냥합니다.
더 보기EMNLP 2026 Findings 연구는 검색 증강형 LLM이 조작된 웹 콘텐츠를 신뢰해 존재하지 않는 상품까지 추천할 수 있음을 보여준다. 추론 모드와 기존 방어 기법도 이 위험을 안정적으로 막지 못했다.
더 보기모델과 프롬프트, 검색 정책을 그대로 유지해도 검색 인덱스를 확장하면 같은 질문에 대한 답변이 바뀔 수 있다는 연구 결과가 나왔다. 연구진은 일반적인 생성 변동성과 인덱스 업데이트의 영향을 분리하는 ‘스냅샷 호환성 감사’를 제안했다.
더 보기RIBOSPAN은 최대 10,240개 뉴클레오타이드의 문맥으로 사전학습한 16억 1천만 파라미터 양방향 RNA 파운데이션 모델입니다. 연구진은 짧은 문맥 모델을 추론 단계에서 확장하는 방식보다 네이티브 장문맥 학습이 전체 전사체 표현에 더 안정적일 수 있음을 보였습니다.
더 보기WorldToken은 각 정책 시점의 다중 시점 이미지, 고유수용감각, 작업 조건을 하나의 월드 토큰으로 묶고 시간 순서로 모델링합니다. 실험은 목표 도메인 데이터와 긴 시간 문맥이 로봇 조작에 중요하다는 점을 보여줍니다.
더 보기ReWorld는 학습 단계에서 단기 행동 제어와 장기 장면 기억을 분리하고, 추론 단계에서는 제한된 KV 캐시와 카메라 포즈 기반 랜드마크 검색을 결합합니다. 무한히 커지는 문맥 없이도 사용자가 다시 방문한 장소의 정보를 불러오려는 접근입니다.
더 보기