아티클 목록으로
AI 에이전트

월가가 주요 AI 에이전트 8종 실측, Qwen Office 종합 1위

약 4분 소요

들어가며

AI 에이전트 경쟁은 이제 단순히 “어떤 모델이 더 똑똑한가”를 비교하는 단계에서 벗어나고 있다. 복잡한 업무를 끝까지 수행하고, 외부 도구를 올바르게 사용하며, 사람이 실제로 활용할 수 있는 결과물을 만들어내는지가 더 중요한 기준이 되고 있다. 제프리스 애널리스트들은 글로벌 주요 AI 에이전트 8개를 대상으로 사무 업무 실측을 진행했고, 그 결과 알리바바의 Qwen Office가 종합 1위를 차지했다고 밝혔다.

다만 이 순위는 특정 과제와 평가 방식에 기반한 기관 보고서의 결과다. 모든 기업 업무에서 동일한 우위를 의미한다고 단정하기보다는, 에이전트 평가 기준이 어떻게 바뀌고 있는지를 보여주는 자료로 보는 편이 적절하다.

모델 이상의 능력을 요구한 다섯 가지 과제

평가 과제는 다섯 가지였다. 여러 파일을 바탕으로 기업 연차보고서 요약을 작성하는 작업, 인터넷에서 기업 경영 데이터를 찾고 비교하는 작업, 실제 데스크톱 브라우저를 조작해 정보를 검색하고 문서를 생성하는 작업, 데이터를 기반으로 영어 PPT를 만드는 작업, 참고 이미지를 활용해 마케팅 포스터를 만드는 작업이다.

보고서에 따르면 Qwen Office는 복잡한 사무 업무, 브라우저 제어, 멀티모달 콘텐츠 생성에서 강점을 보였다. 또한 전체 평가 차원에서 90점 이상을 받은 유일한 제품으로 소개됐다. 이런 과제는 자연스러운 문장 생성만으로 해결되지 않는다. 여러 자료의 맥락을 파악하고, 필요한 시점에 검색하며, 소프트웨어를 조작하고, 오류를 수정한 뒤, 정리된 최종 파일을 제출해야 한다.

숨은 경쟁력으로 떠오른 Harness

제프리스는 에이전트 역량을 기반 모델과 Harness로 나누어 분석했다. Harness는 모델 주변에 구축되는 실행·관리 체계다. 여기에는 지시 설계, 컨텍스트 관리, 도구 호출, 권한과 경계 제어, 피드백, 오류 복구, 거버넌스 등이 포함된다.

보고서의 추정치에서 Qwen Office는 8개 제품 가운데 가장 높은 ‘암묵적 Harness 점수’를 기록했으며, Claude Cowork와 Codex보다 앞선 것으로 나타났다. 강력한 모델이라도 업무를 적절히 분해하지 못하거나 도구를 잘못 호출하고, 오류 발생 시 복구하지 못하면 긴 작업 흐름을 안정적으로 완수하기 어렵다. 반대로 잘 설계된 Harness는 범용 모델의 능력을 더 예측 가능한 업무 결과로 전환할 수 있다.

상용화를 가르는 작업당 비용

에이전트는 여러 차례의 추론과 도구 호출을 필요로 하는 경우가 많고, 장시간 작업에서는 컨텍스트도 유지해야 한다. 따라서 기업은 단일 API 호출 가격보다 실제 업무 하나를 완료하는 데 필요한 총비용, 즉 ‘Cost per Task’를 측정해야 한다.

소재에 따르면 Qwen Office가 사용하는 Qwen 3.8 Max API 가격은 일부 해외 주요 모델보다 낮다. 제프리스는 이를 성능과 비용의 조합 측면에서 장점으로 평가했다. 그러나 API 가격만으로 기업 가치를 판단할 수는 없다. 성공률, 사람의 검수, 권한 관리, 시스템 연동, 오류 수정에 드는 비용까지 함께 계산해야 한다.

기업용 시장의 핵심은 워크플로 연동

에이전트가 개인 생산성 도구에서 기업 업무로 확장되면 커넥터, Skills, 과거 작업 기록, 협업 도구, 권한 체계가 제품 안에 축적될 수 있다. 이런 요소는 사용 지속성을 높이고 다른 제품으로의 전환을 어렵게 만들 가능성이 있다.

Qwen Office는 현재 딩톡 IM 기능과 초기 연동을 진행해 그룹 채팅 요약, 문서·스프레드시트 작성, 메시지와 이메일 송수신 등을 지원하는 것으로 소개됐다. 다음 단계의 관건은 기업 데이터베이스와 실제 업무 프로세스까지 연결해 장기적인 효율 개선을 입증하는 것이다.

이번 실측의 의미는 단순한 1위 제품 발표에 있지 않다. 모델은 출발점이고, Harness는 실행 안정성을 좌우하며, 비용과 생태계는 기업 환경에서의 확장 가능성을 결정한다. 앞으로의 Agent 경쟁은 모델 벤치마크보다 실제 업무 완료율과 운영 경제성에 더 가까워질 가능성이 크다.

출처: 量子位

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Agent Skills는 왜 효과적이고, 왜 실패하는가
AI 에이전트
cctest.ai
AI 에이전트

Agent Skills는 왜 효과적이고, 왜 실패하는가

여러 벤치마크와 에이전트 프레임워크, LLM을 대상으로 한 연구는 Agent Skills의 핵심 효과가 부족한 지식을 주입하는 데 있지 않고, noisy한 실행 기록을 안정적인 절차의 기준점으로 바꾸는 데 있다고 분석했다. 반면 스킬 풀이 커지면 검색이 새로운 병목으로 떠오른다.

더 보기
CCTest · Blog
Agentic ESOpt: 진화 전략으로 장기 작업 LLM 에이전트 미세 조정
AI 에이전트
cctest.ai
AI 에이전트

Agentic ESOpt: 진화 전략으로 장기 작업 LLM 에이전트 미세 조정

Agentic ESOpt는 길고 분기 많은 에이전트 작업을 미세 조정하기 위해 진화 전략을 활용하는 프레임워크를 제안한다. 추론에 가까운 GPU 메모리 사용 방식으로 매개변수를 탐색하고, 모델과 컨텍스트의 공동 최적화를 지향한다.

더 보기
CCTest · Blog
데이터베이스 ACID를 AI 에이전트에 적용하다: 장기 작업을 위한 트랜잭션
AI 에이전트
cctest.ai
AI 에이전트

데이터베이스 ACID를 AI 에이전트에 적용하다: 장기 작업을 위한 트랜잭션

새 연구가 추론과 도구 사용, 코드 생성, 작업 공간 조작을 수행하는 LLM 에이전트를 위해 데이터베이스의 ACID 원칙을 재해석한 ‘에이전틱 트랜잭션’을 제안했다. 관련 벤치마크에서 기존 에이전트보다 10.6% 향상된 결과를 보고했다.

더 보기