OpenAI, 새 음성 모드를 ChatGPT 데스크톱 앱에 적용: 대화에서 에이전트 제어로
OpenAI가 ChatGPT 데스크톱 앱에 새로운 ChatGPT Voice를 추가해 사용자가 음성으로 ChatGPT Work, Codex, 컴퓨터 사용 기능을 지시할 수 있게 했다. 이번 업데이트는 음성을 단순한 대화 입력이 아니라 AI 에이전트 작업을 조율하는 인터페이스로 확장한다.
더 보기OpenAI가 ChatGPT 데스크톱 앱에 새로운 ChatGPT Voice를 추가해 사용자가 음성으로 ChatGPT Work, Codex, 컴퓨터 사용 기능을 지시할 수 있게 했다. 이번 업데이트는 음성을 단순한 대화 입력이 아니라 AI 에이전트 작업을 조율하는 인터페이스로 확장한다.
더 보기AgentDebugX는 LLM 에이전트 실패를 감지, 원인 귀속, 복구, 재실행의 폐쇄 루프로 다루는 오픈소스 프레임워크다. 오류가 드러난 지점과 실제 원인이 발생한 지점이 다를 수 있다는 문제를 정면으로 겨냥한다.
더 보기DataFlow-Harness는 자연어 요청과 플랫폼에 남는 데이터 파이프라인 산출물 사이의 간극을 다룬다. LLM 에이전트가 자유 형식 스크립트를 쓰는 대신, 플랫폼 네이티브 DAG를 단계적으로 만들도록 유도한다.
더 보기NexForge는 LLM Agent 후학습에서 병목이 되는 실행 가능한 훈련 데이터 확장 문제를 다룹니다. 고정 도구나 저장소가 아니라 고수준 능력 요구사항에서 출발해 작업과 전문가 궤적을 생성합니다.
더 보기이 논문의 핵심은 더 큰 범용 모델을 만드는 것이 아니라, 에이전트가 스스로 경로를 점검하며 개선할 수 있는 훈련 환경을 설계한 데 있다. 검증 가능한 상호작용이 자기 개선의 기반이 된다.
더 보기API를 호출하는 에이전트는 많은 고품질 궤적이 필요하지만, 실제 환경을 모두 구축하는 일은 느리고 비쌉니다. 이 논문은 API 명세만으로 LLM이 상태를 가진 환경을 시뮬레이션하도록 합니다.
더 보기새 논문은 협상 값이 암호화돼 있어도 양보 속도, 제안 궤적, 수렴 패턴을 통해 사적 제약이 추론될 수 있다고 지적한다. 연구진은 협상 성능을 유지하면서 추론 공격을 줄이는 적응형 확률 정책을 제안했다.
더 보기RESOURCE2SKILL은 튜토리얼 영상, 코드 저장소, 문서와 참고 결과물을 소프트웨어 에이전트가 재사용할 수 있는 실행형 스킬로 변환하는 프레임워크다.
더 보기Cura 1T는 의료를 단순 질의응답이 아니라 대화, 추론, 진단, 도구 사용이 함께 맞물리는 업무로 본다. 능력별로 목표를 정해 반복 개선하는 훈련 루프가 핵심이다.
더 보기Recursive Harness Self-Improvement는 에이전트를 감싸는 실행 하네스를 고정된 보조물이 아니라 최적화 대상로 본다. 논문은 몇 번의 가벼운 반복만으로 낮은 추론 강도의 에이전트 성능을 높이고 비용을 줄일 수 있다고 보고했다.
더 보기Kimi K3는 공개 직후 모델 광장에 올라오며 큰 관심을 받았다. 핵심은 단순한 규모가 아니라, 코딩·장문 작업·검색·표·프런트엔드까지 넓게 다루는 실전형 능력이다.
더 보기VentureBeat 조사에 따르면 AI 에이전트는 이미 기업의 실제 시스템과 데이터에 접근하고 있지만, 이를 통제할 신원 관리와 격리, 권한 제어는 뒤처져 있다. 응답 기업의 절반 이상이 보안 사고나 아차 사고를 경험했다.
더 보기1Password가 Claude용 브라우저 연동 기능을 출시했다. 사용자가 승인하면 AI 에이전트가 저장된 로그인 정보를 사용할 수 있지만, 비밀번호나 MFA 일회용 코드는 Claude에 직접 노출되지 않는다는 설명이다.
더 보기arXiv의 새 서베이는 자기 개선형 에이전트를 경험을 누적 역량 향상으로 바꾸는 적응형 시스템으로 설명한다. 핵심은 특정 알고리즘이 아니라 모델, 프롬프트, 메모리, 도구, 제어 로직을 포함한 전체 구성이다.
더 보기arXiv 논문은 Agentic AI 배포를 위한 AI 네이티브 보험 프레임워크를 제안한다. 자율성, 운영 권한, 권한 노출, 거버넌스 성숙도, 외부 의존도를 보험 인수와 가격 산정에 연결하는 접근이다.
더 보기Ai2는 해양 분야 AI 에이전트 Shippy의 구축 경험을 공개했다. 핵심은 더 강한 모델 하나가 아니라, 도구와 권한, 샌드박스, 평가 체계를 함께 설계하는 데 있다.
더 보기새 arXiv 논문은 고정 벤치마크에서의 일회성 성능 향상만으로 Agent 최적화 방법을 판단하기 어렵다고 지적한다. 새 작업이 추가되는 지속학습 환경에서는 방법별 차이가 뚜렷하게 드러났다.
더 보기arXiv 논문은 자율 커머스 환경에서 인간, AI 에이전트, 브랜드 간 관계를 설명하기 위해 DVM-HALL 모델과 NHAS 지표를 제안한다. 핵심은 감정적 선호뿐 아니라 신뢰, 위임, 실행 검증 가능성, 온체인 위험까지 충성도 모델에 포함하는 것이다.
더 보기arXiv 논문은 Experience Memory Graph를 통해 LLM 에이전트의 실패 복구를 구조화된 그래프 매칭으로 재정의한다. 반복적인 반성 루프 대신, 관련 수정 경험을 검색해 한 번의 실행을 안내하는 방식이다.
더 보기SPyCE는 멀티모달 에이전트의 추론 궤적을 계층적 스킬 라이브러리로 증류하고, 이를 정책과 함께 훈련 중 갱신하는 프레임워크다. 보상 신호나 정적 메모리에 머물던 경험을 정책 학습의 일부로 끌어들인다.
더 보기arXiv에 공개된 새 논문은 AI 에이전트 권한 시스템 제안 21건을 검토하고, 상용 에이전트 5종의 권한 처리 방식과 비교했다. 핵심은 모든 사용자에게 같은 정책을 적용하는 방식에서 벗어나 사용자별 권한 제어가 필요하다는 점이다.
더 보기