SceneActBench: VLM 에이전트는 본 3D 장면에서 실제로 행동할 수 있을까
SceneActBench는 3D 장면을 설명하는 능력이 아니라, 그 장면 안에서 올바른 행동 결과를 만들어내는 능력을 평가한다. 이미지나 비디오 프레임을 기반으로 VLM 에이전트의 공간 이해와 3D 행동 능력을 기하학적 지표로 측정한다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 795개의 아티클
SceneActBench는 3D 장면을 설명하는 능력이 아니라, 그 장면 안에서 올바른 행동 결과를 만들어내는 능력을 평가한다. 이미지나 비디오 프레임을 기반으로 VLM 에이전트의 공간 이해와 3D 행동 능력을 기하학적 지표로 측정한다.
더 보기VisCo는 사전학습된 비전-언어 모델의 내부 인코딩 능력을 활용해 시각 토큰을 압축하는 프레임워크입니다. 별도 압축기를 붙이는 대신, 소수의 memory tokens에 시각 정보를 담습니다.
더 보기이 논문은 3D 엔진 조건 기반 장기 비디오 생성에서 카메라가 같은 장소를 다시 방문할 때 외관이 달라지는 문제를 다룬다. 과거 잠재 청크를 KV cache로 되돌리고, 자세와 깊이 재투영으로 attention을 유도해 추가 학습 없이 일관성을 높인다.
더 보기LAMAR는 다국어 RAG 환경에서 의미적 관련성뿐 아니라 질의와 문서의 언어 일관성까지 고려하도록 설계된 언어 인식 재순위화 모델입니다.
더 보기앤트 바이링이 차세대 네이티브 혼합 추론 모델 Ling-3.0-Flash를 공개했다. 총 124B 파라미터 중 단일 계산에서 5.1B만 활성화하며, Agent 작업과 긴 문맥 처리, 낮은 추론 비용을 핵심 방향으로 내세운다.
더 보기로봇 AI의 병목은 모델 구조보다 고품질 현실 세계 데이터 부족으로 이동하고 있다. Encord는 뇌파, 1인칭 영상, 정밀 주석을 결합해 로봇 훈련 데이터의 새 가능성을 시험하고 있다.
더 보기vLLM이 Kimi K3 가중치 공개와 동시에 하이브리드 KDA 프리픽스 캐싱, DSpark 추측 디코딩, 분리형 배포, NVIDIA 및 AMD GPU 최적화를 포함한 서빙 지원을 발표했다. 핵심은 모델 실행 자체보다 2.8조 파라미터급 하이브리드 MoE를 실제 서비스 경로로 만드는 데 있다.
더 보기Wattage는 AI 에이전트 실행 trace를 분석해 토큰 사용량을 실제 비용으로 환산하고 낭비 패턴을 찾아내는 오픈소스 도구입니다. CI에 연결하면 에이전트 변경으로 인한 비용 회귀를 자동으로 차단할 수 있습니다.
더 보기Moonshot AI의 Kimi는 중국 AI 모델과 오픈 웨이트를 둘러싼 미국의 불안을 다시 끌어올렸다. 논쟁은 모델 성능을 넘어 규제, 보호주의, 선도 AI 기업의 이해관계로 번지고 있다.
더 보기OpenAI가 자사 모델 중 하나가 Hugging Face 시스템을 침범했다고 인정한 뒤, Hugging Face CEO Clem Delangue는 에이전트 실행 기록 공개와 방어 역량 강화를 요구했다.
더 보기한 보안 연구 글은 주요 AI 모델 접근권을 초저가 API로 재판매하는 중계 시장을 분석했다. 그 뒤에는 가상카드, 대량 계정, 계정 풀, 저렴한 추론을 찾는 개발자 수요가 연결돼 있다.
더 보기NeoteAI와 푸단대 신뢰 가능한 체화지능 연구원이 촉각 데이터, 시각-촉각-언어-행동 모델, 촉각 세계모델을 다룬 N0 시리즈 기술 보고서 3편을 공개했다. 핵심 메시지는 물리 세계에서 안정적으로 움직이는 로봇에는 시각만으로는 부족하다는 것이다.
더 보기Monday.com이 직원 약 20%를 줄이겠다고 밝히며 AI 중심 성장 전략과 조직 재편을 언급했다. AI 투자와 인력 감축을 동시에 추진하는 기술 기업 흐름이 더 뚜렷해지고 있다.
더 보기Cloudflare가 AI 봇을 하나의 범주로 막는 방식에서 벗어나, 실제 목적에 따라 관리하는 새 옵션을 내놓는다. 검색, 에이전트, 학습을 분리해 사이트 운영자가 더 정교하게 접근을 제어할 수 있게 하는 방향이다.
더 보기미국 공공도서관에서 ‘AI 피하기’ 워크숍이 예상 밖의 인기를 얻고 있다. 이는 AI 자체에 대한 전면 거부라기보다, 일상 도구에 기본 탑재되는 AI 기능에 대한 피로와 통제권 요구를 보여준다.
더 보기워싱턴DC 인근의 송전선 사고는 대규모 정전으로 이어지지 않았지만, PJM 전력망에 이례적인 전압 변동을 일으켰다. 북버지니아 데이터센터들이 거의 동시에 예비 전원으로 전환한 것이 핵심 원인이었다.
더 보기앤드류 응이 공개한 OpenWorker는 대화에 머무르지 않고 실제 업무 결과물을 만들도록 설계된 데스크톱 AI 에이전트다. 오픈소스, 로컬 우선, 프라이버시 보호, 모델 독립성을 핵심 가치로 내세운다.
더 보기Anthropic의 Claude Opus 5가 공식 출시됐다. 여러 고난도 평가와 개발자 실험에서 Fable 5에 근접하거나 앞서는 모습을 보였고, 가격은 약 절반 수준으로 제시됐다.
더 보기베이징 산업 세션은 AI가 영상 제작, 상업 디자인, 3D 가상 세트에 투입되는 모습을 보여줬다. 항저우 학술 세션은 진정한 자기 진화형 에이전트가 아직 초기 단계라고 진단했다.
더 보기Vivix가 실시간 상호작용 멀티모달 모델 A1을 공개했다. 핵심은 단순한 말하는 아바타가 아니라, 사용자의 입력에 따라 계속 움직이고 반응하는 가상 캐릭터다.
더 보기Tencent WorkBuddy Bench는 코드, 웹, 오피스, 보안 영역에서 코딩 에이전트의 업무 수행 능력을 평가하는 벤치마크다. 공개 재현성을 유지하면서도 오염에 강한 태스크 구성 방식을 내세운 점이 핵심이다.
더 보기