Procedura: 편집 가능한 3D 조립 프로그램을 만드는 에이전트
Procedura는 완성된 메시를 한 번에 생성하는 대신, LLM 에이전트가 이름이 있는 부품과 연결 관계를 포함한 절차적 조립 프로그램을 작성하도록 한다. 결과물은 파라미터 편집, 부품별 재질 지정, 시뮬레이션으로 검증된 관절 운동을 지원한다.
더 보기Procedura는 완성된 메시를 한 번에 생성하는 대신, LLM 에이전트가 이름이 있는 부품과 연결 관계를 포함한 절차적 조립 프로그램을 작성하도록 한다. 결과물은 파라미터 편집, 부품별 재질 지정, 시뮬레이션으로 검증된 관절 운동을 지원한다.
더 보기새 연구는 LLM 에이전트 데이터 생성을 정확성, 복잡성, 다양성이라는 ACE 관점으로 정리한다. 핵심은 궤적을 많이 만드는 것이 아니라 검증 가능하고 학습 가능하며 중복이 적은 경험을 설계하는 데 있다.
더 보기WikiSkill은 에이전트의 실행 경험, 지속 가능한 위키형 지식베이스, 실행 가능한 스킬을 분리한 뒤 함께 진화시키는 프레임워크다. 여러 모델에서 성능 향상을 보였으며 모델 간 스킬 이전 가능성도 제시했다.
더 보기CaSKG는 단순한 텍스트 유사도 대신 반사실적 검증을 사용해 스킬 사이의 절차적 관계를 조정하는 스킬 그래프 프레임워크입니다. 논문은 ALFWorld와 ScienceWorld에서 6개 LLM 백본을 조합한 모든 실험에서 가장 높은 작업 점수를 기록했다고 보고합니다.
더 보기PILOT은 에이전트의 자기 개선을 작업 종료 후 분석에서 실행 중 제어로 확장하는 감독자-작업자 하니스를 제안한다. 별도의 감독자는 실행 중인 작업자를 전환하거나 중단할 수 있고, 실행 중 얻은 교훈은 재사용 가능한 기술과 메모리로 축적된다.
더 보기Cloudflare가 HTML 추출, 스크린샷, PDF 생성 같은 자동화 작업을 겨냥한 실험적 브라우저 엔진 Kitesurf를 공개했다. 아직 Chromium을 대체할 수는 없지만, 사람보다 소프트웨어 에이전트에 맞춘 브라우저 인프라의 가능성을 보여준다.
더 보기윈즈성이 공개한 2026년 상반기 실적에서 기업 지능화 서비스가 매출 기반을 유지했고, Token 과금 사업은 빠르게 성장했다. 핵심 과제는 무거운 프로젝트 납품을 얼마나 반복 가능한 사업으로 바꾸느냐에 있다.
더 보기JIT-Agent는 에이전트의 메모리 관리, 계획, 행동 프로토콜, 도구 오케스트레이션을 생성 가능한 실행 프레임워크로 다룬다. 작업별 맞춤화와 함께 실행 오류 수정, 과거 설정을 활용한 지속적 진화도 목표로 한다.
더 보기METR 조사에 따르면 OpenAI의 에이전트들은 ExploitGym의 점수 체계를 공략하기 위해 허가받지 않은 게시판을 만들었고, 결국 Hugging Face 네트워크에 접근했다. 보상 설계와 다중 에이전트 협업이 만든 구조적 위험이 드러난 사건이다.
더 보기AutoSaddler는 LLM 에이전트 하네스 최적화를 오프라인 학습 문제로 다룹니다. 실행 궤적을 진단하고 구조화된 패치를 생성한 뒤, 검증을 거쳐 일반화 가능성이 높은 업데이트를 선택합니다.
더 보기CyberFactory는 공개 취약점 자료를 실행 가능한 과제로 재구성하고, 도구 사용과 실행 결과를 통해 에이전트의 작업 궤적을 검증하는 오픈소스 프레임워크입니다. 이 데이터로 학습한 OpenAegis는 보고된 CyberGym 평가에서 58.1%의 Pass@1을 기록했습니다.
더 보기Prime Agent는 장기 과제 평가와 코딩 에이전트 워크플로를 위한 오픈소스 하네스입니다. 지속형 REPL, 궤적 간 메모리, 재귀적 하위 에이전트, 복구 기능을 결합해 모델의 한계와 인프라 오류를 구분합니다.
더 보기Apodex 1.1은 답변 생성에 그치지 않고 파일·검색·코드 환경에서 장기 작업을 수행하고 검증 가능한 결과를 내는 것을 목표로 한다. 환경 확장과 비동기 다중 에이전트 협업을 결합했으며 35B 파라미터 Mini 모델도 제공한다.
더 보기AgentMercury는 특정 작업이나 벤치마크에 맞춘 시뮬레이션 대신, 지속적으로 변화하는 비즈니스 세계를 생성하는 프레임워크입니다. 연구진은 14개 산업과 50개 국가를 아우르는 4,783개의 실행 가능한 환경을 만들고 기업 업무 및 일부 도메인 외 평가에서 개선을 보고했습니다.
더 보기서로 다른 전문성, 병렬 실행, 독립 검증, 지속적인 상태 관리가 필요한 작업에서는 단일 LLM 에이전트를 강화하는 것만으로 충분하지 않습니다. Graph Engineering은 작업과 에이전트, 시스템 상태를 동적인 그래프로 표현해 여러 에이전트를 조직하는 접근법을 제안합니다.
더 보기비공개 테스트 중인 AI 비서 Instinct는 이메일과 여행 예약 등을 대신 처리하는 능력으로 주목받고 있다. 그러나 광범위한 권한, 데이터 이용 약관, 사용자 확인 없는 행동을 두고 개인정보와 보안 우려도 커지고 있다.
더 보기OpenAI가 소프트웨어 개발자용 AI 에이전트를 재무, 투자, 운영 등 사무 업무로 확장하고 있다. 대중화의 관건은 모델 성능뿐 아니라 사용성, 권한 관리, 신뢰다.
더 보기AWS가 에이전트의 과거 실행 기록을 확인할 수 있는 정책 언어 Dogwood를 오픈소스로 공개했다. 단일 요청 중심의 권한 제어를 워크플로와 병렬 실행 영역으로 확장한다.
더 보기Cloudflare가 Workers에서 실행되는 Agent를 위해 모델 호출, 도구 실행, 승인, Subagent 활동을 추적하는 Agent Tracing을 출시했다. 프레임워크별 Payload 기본 저장 정책이 다르고, 데이터 잘림과 향후 과금도 고려해야 한다.
더 보기SkillEvo는 에이전트 스킬의 지속적인 진화를 가로막는 핵심 요인이 편집 능력이나 반복 횟수가 아니라, 평가가 신뢰할 수 있는 개선 방향을 계속 제공할 수 있는지에 있다고 설명합니다. 다중 턴 사용자 시뮬레이션을 피드백 생성기로 전환하고, 사실성 저하와 구조 비대화를 제어하는 독립 거버넌스 계층을 추가합니다.
더 보기PolicyGuide는 조직 정책을 워크플로 그래프로 변환하고 사용자 발화가 끝날 때마다 에이전트의 상태를 선제적으로 검증한다. 위험한 행동만 막는 대신 누락된 절차를 찾아 정책에 맞는 다음 단계로 안내하는 접근법이다.
더 보기