아티클 & 가이드

메모리·컨텍스트

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 29개의 아티클

CCTest · Blog
Agent 메모리는 검색만의 문제가 아니다: ACM이 제시한 컨텍스트 생애주기 관리
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

Agent 메모리는 검색만의 문제가 아니다: ACM이 제시한 컨텍스트 생애주기 관리

이 논문은 Agentic Context Management를 제안하며, 프로덕션 에이전트의 실패 원인이 추론 능력보다 현재 추론 컨텍스트를 관리하지 못하는 데 있는 경우가 많다고 주장한다.

더 보기
CCTest · Blog
ReflectWorld-MM, 프레임이 아닌 엔티티로 비디오를 기억하다
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

ReflectWorld-MM, 프레임이 아닌 엔티티로 비디오를 기억하다

ReflectWorld-MM은 연속되는 영상 속에서 누가 다시 나타났는지, 무엇이 변했는지를 엔티티 단위로 기억하려는 시스템이다. 단순 저장이 아니라, 세계 경험을 구조화해 축적하는 방향으로 비디오 메모리를 재설계했다.

더 보기
CCTest · Blog
RecGPT-V3: 추천 시스템을 ‘과거 재생’에서 ‘기억 기반 의도 이해’로
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

RecGPT-V3: 추천 시스템을 ‘과거 재생’에서 ‘기억 기반 의도 이해’로

RecGPT-V3는 지속적으로 진화하는 사용자 메모리, Semantic IDs 기반 상품 grounding, 잠재 토큰 추론을 결합한 산업용 LLM 추천 시스템이다. 타오바오 ‘Guess What You Like’ 피드 적용 결과 GMV +3.97%, 서빙 리소스 소비 52.4% 감소가 보고됐다.

더 보기
CCTest · Blog
xHC: Transformer 잔차 스트림을 N=16까지 확장하는 방법
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

xHC: Transformer 잔차 스트림을 N=16까지 확장하는 방법

xHC는 Hyper-Connections를 기존의 N=4 한계 너머로 확장해, 잔차 스트림 폭을 대규모 언어 모델 사전학습의 새로운 스케일링 축으로 만들려는 연구입니다. N=16 상태를 유지하면서 일부 스트림만 갱신해 성능과 비용의 균형을 맞춥니다.

더 보기
CCTest · Blog
KV Cache 접목으로 검증된 지식을 재사용하는 동결 소형 모델
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

KV Cache 접목으로 검증된 지식을 재사용하는 동결 소형 모델

새 논문은 검증된 지식을 바이트 단위로 정확한 KV Cache 상태로 저장한 뒤, 이후 추론에 다시 접목하는 방식을 제안한다. 반복 사례에서는 큰 비용 절감이 보고됐지만, 재현성과 ‘추론 능력 향상’의 의미는 신중히 봐야 한다.

더 보기
CCTest · Blog
KV Cache도 편향된다: 구조 토큰을 과도하게 남기는 장문 추론의 문제
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

KV Cache도 편향된다: 구조 토큰을 과도하게 남기는 장문 추론의 문제

새 arXiv 논문은 주의량 기반 KV Cache 제거 방식이 중첩 JSON 같은 구조 밀집 입력에서 구조 토큰을 과도하게 보존할 수 있다고 지적한다. 저자는 재학습 없이 적용 가능한 역할 조건부 할당 방식으로 이를 완화한다.

더 보기
CCTest · Blog
HealthClaw: 장기 개인 건강 관리를 위한 자기 진화형 AI 에이전트
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

HealthClaw: 장기 개인 건강 관리를 위한 자기 진화형 AI 에이전트

arXiv에 공개된 새 논문은 지속적인 개인 건강 관리를 위한 오픈소스 에이전트 아키텍처 HealthClaw를 제안한다. 매번의 질문을 독립적으로 처리하는 대신, 사용자의 습관·선호·측정값·위험 변화에 맞춰 사적 장기 기억을 갱신한다.

더 보기