1년간 쇼핑몰 운영으로 검증한 LLM 에이전트의 장기 자율성
들어가며
상품을 검색하고 광고 문구를 작성하거나 몇 가지 도구를 호출할 수 있다고 해서 사업을 운영할 수 있는 것은 아닙니다. 전자상거래에서는 한 시점의 구매 결정이 훗날의 재고, 현금, 수익에 영향을 줍니다. 할인은 판매를 늘릴 수 있지만 자금 부담을 키울 수 있고, 반품이나 공급 차질은 이전 판단의 문제를 뒤늦게 드러냅니다. E-Commerce Bench는 이런 장기적인 의사결정의 연결고리를 측정하기 위해 만들어졌습니다.
365일 동안 매장을 운영하는 과제
이 벤치마크에서 LLM 에이전트는 365일 동안 여러 온라인 매장을 동시에 운영합니다. 시장 조사, 상품 선정, 재고 조달, 공급업체 협상, 판매 전략 조정, 주문 이행, 반품 처리, 현금흐름 관리가 모두 과제에 포함되며, 목표는 연말 총자산을 최대화하는 것입니다. 짧은 도구 사용 평가와 달리 초기의 가격이나 조달 판단이 이후의 재고와 유동성에 계속 영향을 줍니다.
상품과 공급업체 데이터는 실제 전자상거래 플랫폼에서 가져왔습니다. 여기에 프로모션, 자연재해, 공급망 충격이 포함된 연간 일정이 더해져 시간에 따라 수요가 변합니다. 따라서 에이전트는 고정된 가격 규칙을 반복하는 데 그치지 않고, 결과에서 경험을 얻어 운영 정책을 조정해야 합니다.
평가의 핵심 설계
- 다중 라운드 협상: 조달 과정에서 단순 견적 비교가 아니라 가격, 양보, 공급 결정을 처리합니다.
- 장기 일관성: 365일의 기간 동안 계획 수립과 상태 추적 능력을 시험합니다.
- 다차원 평가: 18개 프런티어 모델을 연말 자산만이 아니라 7개 차원에서 비교합니다.
- 재현 가능한 시장: 고객 구매와 반품은 고정 수요 모델을 따르며, 협상 커널이 공급업체의 가격과 양보, 의사결정을 결정합니다. LLM은 주로 그 결과를 언어로 표현합니다.
제공된 초록에 따르면 모든 항목을 지배하는 단일 모델은 없었습니다. GPT-5.6 Sol은 초기 자금 100,000을 1,431,425로 늘려 보고된 연말 자산에서 가장 높은 성과를 냈습니다. 그러나 사기 회피 차원에서는 18개 모델 중 16위였고, 해당 차원에서 Fable5 i…보다 뒤처졌습니다. 초록이 중간에 잘려 있으므로 나머지 순위와 세부 결과는 논문 본문을 확인해야 합니다.
의미와 한계
이 연구는 에이전트 평가의 초점을 짧은 작업 연결에서 지속적인 사업 운영으로 확장합니다. 실제 상거래 에이전트를 평가할 때는 수익이나 최종 자산뿐 아니라 위험 회피, 재고 관리, 현금 보존, 환경 변화에 대한 적응도 함께 살펴봐야 한다는 점을 보여줍니다.
결정론적 시장은 공정한 비교와 재현성에 유리하지만, 실제 전자상거래 환경을 그대로 대체하지는 않습니다. 이 테스트가 주로 계획, 기억, 행동, 정책 수정 능력을 통제된 조건에서 분리해 보기 때문입니다. 기업이 얻을 수 있는 실무적 교훈은 분명합니다. 가장 많은 돈을 번 모델이 실제 매장을 맡기기에 가장 안전하거나 균형 잡힌 모델이라고 단정할 수는 없습니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…