아티클 목록으로
모델 평가

1년간 쇼핑몰 운영으로 검증한 LLM 에이전트의 장기 자율성

약 3분 소요

들어가며

상품을 검색하고 광고 문구를 작성하거나 몇 가지 도구를 호출할 수 있다고 해서 사업을 운영할 수 있는 것은 아닙니다. 전자상거래에서는 한 시점의 구매 결정이 훗날의 재고, 현금, 수익에 영향을 줍니다. 할인은 판매를 늘릴 수 있지만 자금 부담을 키울 수 있고, 반품이나 공급 차질은 이전 판단의 문제를 뒤늦게 드러냅니다. E-Commerce Bench는 이런 장기적인 의사결정의 연결고리를 측정하기 위해 만들어졌습니다.

365일 동안 매장을 운영하는 과제

이 벤치마크에서 LLM 에이전트는 365일 동안 여러 온라인 매장을 동시에 운영합니다. 시장 조사, 상품 선정, 재고 조달, 공급업체 협상, 판매 전략 조정, 주문 이행, 반품 처리, 현금흐름 관리가 모두 과제에 포함되며, 목표는 연말 총자산을 최대화하는 것입니다. 짧은 도구 사용 평가와 달리 초기의 가격이나 조달 판단이 이후의 재고와 유동성에 계속 영향을 줍니다.

상품과 공급업체 데이터는 실제 전자상거래 플랫폼에서 가져왔습니다. 여기에 프로모션, 자연재해, 공급망 충격이 포함된 연간 일정이 더해져 시간에 따라 수요가 변합니다. 따라서 에이전트는 고정된 가격 규칙을 반복하는 데 그치지 않고, 결과에서 경험을 얻어 운영 정책을 조정해야 합니다.

평가의 핵심 설계

  • 다중 라운드 협상: 조달 과정에서 단순 견적 비교가 아니라 가격, 양보, 공급 결정을 처리합니다.
  • 장기 일관성: 365일의 기간 동안 계획 수립과 상태 추적 능력을 시험합니다.
  • 다차원 평가: 18개 프런티어 모델을 연말 자산만이 아니라 7개 차원에서 비교합니다.
  • 재현 가능한 시장: 고객 구매와 반품은 고정 수요 모델을 따르며, 협상 커널이 공급업체의 가격과 양보, 의사결정을 결정합니다. LLM은 주로 그 결과를 언어로 표현합니다.

제공된 초록에 따르면 모든 항목을 지배하는 단일 모델은 없었습니다. GPT-5.6 Sol은 초기 자금 100,000을 1,431,425로 늘려 보고된 연말 자산에서 가장 높은 성과를 냈습니다. 그러나 사기 회피 차원에서는 18개 모델 중 16위였고, 해당 차원에서 Fable5 i…보다 뒤처졌습니다. 초록이 중간에 잘려 있으므로 나머지 순위와 세부 결과는 논문 본문을 확인해야 합니다.

의미와 한계

이 연구는 에이전트 평가의 초점을 짧은 작업 연결에서 지속적인 사업 운영으로 확장합니다. 실제 상거래 에이전트를 평가할 때는 수익이나 최종 자산뿐 아니라 위험 회피, 재고 관리, 현금 보존, 환경 변화에 대한 적응도 함께 살펴봐야 한다는 점을 보여줍니다.

결정론적 시장은 공정한 비교와 재현성에 유리하지만, 실제 전자상거래 환경을 그대로 대체하지는 않습니다. 이 테스트가 주로 계획, 기억, 행동, 정책 수정 능력을 통제된 조건에서 분리해 보기 때문입니다. 기업이 얻을 수 있는 실무적 교훈은 분명합니다. 가장 많은 돈을 번 모델이 실제 매장을 맡기기에 가장 안전하거나 균형 잡힌 모델이라고 단정할 수는 없습니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
AgentJudgeBench, 도구 호출 에이전트를 평가하는 LLM의 신뢰성 검증
모델 평가
cctest.ai
모델 평가

AgentJudgeBench, 도구 호출 에이전트를 평가하는 LLM의 신뢰성 검증

AgentJudgeBench는 개방형 텍스트 선호도가 아니라 의존 관계가 있는 도구 호출 워크플로에서 LLM 평가자를 시험한다. 결과는 평가 신뢰성이 모델 규모보다 작업 난도에 더 크게 좌우될 수 있음을 보여준다.

더 보기
CCTest · Blog
RealSWE: 실제 사용자 요청으로 다시 보는 코딩 에이전트 평가
모델 평가
cctest.ai
모델 평가

RealSWE: 실제 사용자 요청으로 다시 보는 코딩 에이전트 평가

SWE-bench의 문제는 대체로 정형화되고 정보가 풍부하지만, 실제 사용자의 요청은 짧고 구어체이며 맥락이 부족한 경우가 많습니다. RealSWE는 현실적인 입력이 평균 해결률을 낮추고 모델 순위까지 바꿀 수 있음을 보여줍니다.

더 보기