PolicyGuide, 단일 행동 차단에서 전체 업무 흐름 안내로
PolicyGuide는 조직 정책을 워크플로 그래프로 변환하고 사용자 발화가 끝날 때마다 에이전트의 상태를 선제적으로 검증한다. 위험한 행동만 막는 대신 누락된 절차를 찾아 정책에 맞는 다음 단계로 안내하는 접근법이다.
더 보기PolicyGuide는 조직 정책을 워크플로 그래프로 변환하고 사용자 발화가 끝날 때마다 에이전트의 상태를 선제적으로 검증한다. 위험한 행동만 막는 대신 누락된 절차를 찾아 정책에 맞는 다음 단계로 안내하는 접근법이다.
더 보기EnvHarness는 기존 환경을 처음부터 다시 만드는 대신 플러그인 계층으로 동작을 재구성한다. EnvRigger는 정책의 실행 궤적을 분석해 약점을 겨냥한 환경 구성 요소를 만들고 새로운 롤아웃으로 검증한다.
더 보기Nvidia 연구진은 모델 자체를 바꾸지 않고도 주변 소프트웨어 계층을 조정해 장기 과제 성능을 크게 높였습니다. 기억 관리, 도구 사용, 감독 에이전트가 에이전트 시스템의 핵심 요소로 떠오르고 있습니다.
더 보기Meta AI Research가 Apache 2.0 라이선스의 오픈 웨이트 모델 Muse Glimmer를 공개했습니다. 이 모델은 로컬 환경에서 비전 입력, 코딩, 다단계 도구 호출과 오류 복구를 수행하도록 설계됐습니다.
더 보기AI 영상 경쟁의 기준이 인상적인 한 장면을 만드는 능력에서 브리프를 이해하고 여러 버전을 일관된 과정으로 납품하는 능력으로 이동하고 있다.
더 보기OpenConnector는 AI 에이전트와 애플리케이션 개발자를 위한 오픈소스 커넥터 게이트웨이입니다. SaaS 인증, 권한 관리, API 변환, 실행 감사를 하나의 런타임에서 다루는 것을 목표로 합니다.
더 보기슬랙이 개발 과제별로 AI 코딩 에이전트와 팀이 협업할 수 있는 Slack Code를 선보였다. 팀원은 코드 변경 사항과 HTML 결과를 확인하고 출시 전에 피드백과 승인을 남길 수 있다.
더 보기바이낸스가 ChatGPT, Claude Code, Cursor 같은 AI 도구를 거래·결제·블록체인 인프라에 연결하는 Agent OS를 출시했다. 에이전트는 사용자를 대신해 주문할 수 있지만, 구체적인 위험 통제는 대부분 사용자가 설정해야 한다.
더 보기제프리스 애널리스트들이 글로벌 주요 AI 에이전트 8개를 실제 사무 업무로 비교한 결과, 알리바바의 Qwen Office가 종합 1위를 차지했다. 이번 결과는 모델 성능뿐 아니라 실행 구조인 Harness와 작업당 비용이 기업 도입의 핵심 변수가 되고 있음을 보여준다.
더 보기Agentic ESOpt는 길고 분기 많은 에이전트 작업을 미세 조정하기 위해 진화 전략을 활용하는 프레임워크를 제안한다. 추론에 가까운 GPU 메모리 사용 방식으로 매개변수를 탐색하고, 모델과 컨텍스트의 공동 최적화를 지향한다.
더 보기여러 벤치마크와 에이전트 프레임워크, LLM을 대상으로 한 연구는 Agent Skills의 핵심 효과가 부족한 지식을 주입하는 데 있지 않고, noisy한 실행 기록을 안정적인 절차의 기준점으로 바꾸는 데 있다고 분석했다. 반면 스킬 풀이 커지면 검색이 새로운 병목으로 떠오른다.
더 보기새 연구가 추론과 도구 사용, 코드 생성, 작업 공간 조작을 수행하는 LLM 에이전트를 위해 데이터베이스의 ACID 원칙을 재해석한 ‘에이전틱 트랜잭션’을 제안했다. 관련 벤치마크에서 기존 에이전트보다 10.6% 향상된 결과를 보고했다.
더 보기UI-Mate는 환경 기반 학습 파이프라인과 문맥 내 시연 학습을 결합해 장기 컴퓨터 작업을 수행하는 GUI 에이전트입니다. 제공된 논문 요약에 따르면 UI-Mate-27B는 OSWorld-Verified에서 77.0%를 기록했습니다.
더 보기StateM은 모델 가중치를 수정하는 대신 지속 상태와 검증 가능한 실행 전이를 제공하는 런타임으로 장기 작업 에이전트의 신뢰성을 높인다. Terminal-Bench 2.1에서 GPT-5.6 Sol xhigh로 95.3%의 원시 정확도를 기록했다.
더 보기VibeLifeBench는 짧은 명령 수행이 아니라, 조용히 변하는 생활 환경 속에서 몇 주간 이어지는 과제를 AI 에이전트가 감당할 수 있는지 평가한다.
더 보기Ouroboros는 도구, 프롬프트, 컨텍스트 조립 방식, 핵심 구현까지 개선 대상으로 삼는 자기 발전형 에이전트 하네스다. 논문은 여러 벤치마크에서 높은 성과를 보고하는 동시에, 자기 수정 에이전트의 안전 거버넌스를 핵심 과제로 제시한다.
더 보기Cloudflare가 사람 대신 AI 에이전트가 쓰도록 설계한 클라우드 호스팅 브라우저 Kitesurf를 공개했다. 회사는 일반적인 자동화 작업에서 Chromium보다 적은 컴퓨팅 자원을 사용할 수 있다고 설명한다.
더 보기앤트그룹이 멀티 에이전트 협업 인프라 Avernet을 오픈소스로 공개하고 커뮤니티 버전을 출시했다. 첫 버전은 에이전트 발견, 합의, 협업, 거버넌스 기능에 초점을 맞춘다.
더 보기Video-DeepResearch는 정적 이미지 중심의 멀티모달 에이전트를 연속 비디오 스트림으로 확장한다. 시각 도구를 건너뛰고 텍스트 검색으로 바로 가는 편향과 내부 기억 의존 문제를 함께 겨냥한다.
더 보기Skill-α는 에이전트 스킬 생성을 한 번의 작성이 아니라 순차적 편집 과정으로 정의하고, 각 편집이 실제 하위 작업 성능을 높이는지 평가한다. 문서 기반과 경험 기반 스킬 생성 모두에서 기존 휴리스틱 및 파이프라인 방식보다 나은 결과를 보였다.
더 보기LongHorizon-Harness는 장기 작업에서 실행 컨텍스트와 작업 상태를 분리하고, 환경에서 검증된 사실만 상태에 반영하는 에이전트 하네스다.
더 보기