아티클 목록으로
메모리·컨텍스트

RecGPT-V3: 추천 시스템을 ‘과거 재생’에서 ‘기억 기반 의도 이해’로

약 3분 소요

도입

추천 시스템은 사용자의 과거 클릭 패턴으로 다음 행동을 예측하는 방식에서, 그 행동 뒤에 있는 의도를 이해하는 방향으로 이동하고 있다. RecGPT-V3 Technical Report는 타오바오 추천 파이프라인에 대형 언어 모델을 적용해 온 RecGPT-V1, V2의 연장선에 있다. V3의 핵심은 LLM이 사용자를 이해할 수 있다는 주장에 그치지 않고, 그 이해를 계속 보존하고 상품 공간에 정확히 연결하며 산업 규모에서 감당 가능한 비용으로 운영하는 데 있다.

핵심 포인트

  • 무상태 요청에서 지속적인 사용자 메모리로: 많은 온라인 추천 시스템은 요청이 들어올 때마다 사용자의 긴 행동 이력을 다시 처리한다. 이는 계산 낭비일 뿐 아니라 이전 분석을 재사용하지 못하게 만든다. RecGPT-V3는 Memory Hub를 도입해 장기 행동을 구조화된 메모리 단위로 압축하고 계속 갱신한다. 보고서에 따르면 사용자 모델링 계산량은 55.8% 줄었다.
  • 자연어 태그에서 구체적 상품 grounding으로: 자연어 태그는 개방적이고 복잡한 수요를 표현하는 데 유용하지만, 사용자 이해와 실제 상품 선택 사이에서 정보 손실을 만들 수 있다. V3는 자연어 태그와 Semantic IDs(SIDs)를 함께 다루는 하이브리드 모달 기반 모델을 사용한다. 자연어는 넓은 의도를 표현하고, SIDs는 그 의도를 실제 상품 공간에 직접 연결한다.
  • 긴 명시적 추론에서 잠재 의도 추론으로: 온라인 추천에서 매 요청마다 긴 chain-of-thought를 생성하면 지연 시간과 비용이 커진다. Latent Intent Reasoning은 많은 명시적 추론 토큰을 더 압축된 학습 가능한 잠재 토큰으로 내재화한다. 필요할 때는 이 추론 흔적을 사람이 읽을 수 있는 설명으로 다시 디코딩할 수 있다. 보고서는 엔드투엔드 추론 3.46배 가속과 출력 토큰 비용 200배 절감을 제시했다.
  • 실서비스 결과: RecGPT-V3는 타오바오 홈페이지의 ‘Guess What You Like’ 피드에 배포됐다. 대규모 A/B 테스트에서 IPV +1.28%, CTR +1.00%, TC +1.97%, GMV +3.97%가 보고됐고, 동시에 엔드투엔드 서빙 리소스 소비는 52.4% 감소했다.

의미와 영향

RecGPT-V3가 흥미로운 이유는 단순히 LLM을 추천에 사용했기 때문만은 아니다. 메모리, 상품 grounding, 추론 효율이라는 실제 운영 제약을 동시에 다룬다는 점이 중요하다. Memory Hub는 사용자 이해를 매번 반복되는 계산이 아니라 지속되는 상태로 바꾼다. Semantic IDs는 언어 수준의 의도를 상품 ID 세계로 연결한다. 잠재 추론은 깊은 reasoning의 장점을 유지하면서도 온라인 서비스가 요구하는 낮은 지연과 낮은 비용에 맞추려는 접근이다.

이는 산업용 추천 시스템의 다음 방향을 보여준다. LLM이 기존 추천 스택 전체를 대체하기보다는, 의도 이해와 메모리 관리, 설명 생성 계층으로 작동하며 검색, 랭킹, 상품 ID, 행동 시퀀스와 결합될 가능성이 크다. 전자상거래와 콘텐츠 피드에서는 모델의 지능뿐 아니라 높은 동시성, 낮은 지연, 해석 가능성, 비즈니스 지표 사이의 균형이 중요하다.

다만 제공된 자료는 기술 보고서 요약과 프로젝트 소개가 중심이어서 외부 재현 세부 정보는 제한적이다. 그럼에도 RecGPT-V3는 프로덕션 LLM 추천에 필요한 조건을 분명히 보여준다. 지속적인 사용자 메모리, 구체적 상품 grounding, 실시간 서빙을 전제로 한 압축 추론이 그것이다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
xHC: Transformer 잔차 스트림을 N=16까지 확장하는 방법
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

xHC: Transformer 잔차 스트림을 N=16까지 확장하는 방법

xHC는 Hyper-Connections를 기존의 N=4 한계 너머로 확장해, 잔차 스트림 폭을 대규모 언어 모델 사전학습의 새로운 스케일링 축으로 만들려는 연구입니다. N=16 상태를 유지하면서 일부 스트림만 갱신해 성능과 비용의 균형을 맞춥니다.

더 보기
CCTest · Blog
KV Cache 접목으로 검증된 지식을 재사용하는 동결 소형 모델
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

KV Cache 접목으로 검증된 지식을 재사용하는 동결 소형 모델

새 논문은 검증된 지식을 바이트 단위로 정확한 KV Cache 상태로 저장한 뒤, 이후 추론에 다시 접목하는 방식을 제안한다. 반복 사례에서는 큰 비용 절감이 보고됐지만, 재현성과 ‘추론 능력 향상’의 의미는 신중히 봐야 한다.

더 보기
CCTest · Blog
KV Cache도 편향된다: 구조 토큰을 과도하게 남기는 장문 추론의 문제
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

KV Cache도 편향된다: 구조 토큰을 과도하게 남기는 장문 추론의 문제

새 arXiv 논문은 주의량 기반 KV Cache 제거 방식이 중첩 JSON 같은 구조 밀집 입력에서 구조 토큰을 과도하게 보존할 수 있다고 지적한다. 저자는 재학습 없이 적용 가능한 역할 조건부 할당 방식으로 이를 완화한다.

더 보기