아티클 & 가이드

메모리·컨텍스트

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 23개의 아티클

CCTest · Blog
하이브리드 언어 모델의 분업: 어텐션은 기억하고 순환 상태는 표현을 결정한다
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

하이브리드 언어 모델의 분업: 어텐션은 기억하고 순환 상태는 표현을 결정한다

Qwen3.5와 Falcon-H1을 분석한 연구에서 KV 캐시와 고정 크기 순환 상태가 뚜렷하게 다른 역할을 맡는 것으로 나타났다. 어텐션은 문맥에 나온 정보를 검색하고, 순환 상태는 출력 언어와 페르소나를 주로 결정한다.

더 보기
CCTest · Blog
LatentStream, 스트리밍 영상 기억을 검색에서 내재화로
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

LatentStream, 스트리밍 영상 기억을 검색에서 내재화로

LatentStream은 스트리밍 영상 이해를 위한 잠재 작업 메모리 프레임워크를 제안한다. 과거 영상을 외부 문맥으로 반복 검색하는 대신, 관련 증거를 작고 진화하는 잠재 표현으로 단계적으로 내재화하는 방식이다.

더 보기
CCTest · Blog
KV 캐시 축출은 정교할 필요가 없을까: Random Attention의 재검토
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

KV 캐시 축출은 정교할 필요가 없을까: Random Attention의 재검토

Random Attention은 긴 추론 과정에서 KV 캐시의 모든 토큰을 중요도 점수로 선별하지 않아도 될 수 있음을 보였다. 프롬프트를 보존하고 각 어텐션 헤드에서 나머지를 무작위로 축출해도 강력한 기존 방식에 가까운 성능을 낸다.

더 보기
CCTest · Blog
LatentPress, 연속 메모리 토큰으로 LLM 컨텍스트를 직접 압축
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

LatentPress, 연속 메모리 토큰으로 LLM 컨텍스트를 직접 압축

LatentPress는 대화 기록과 긴 문서를 사람이 읽는 요약문이나 이미지가 아닌 연속 메모리 토큰으로 변환한다. 고정된 디코더가 입력 임베딩 인터페이스를 통해 이를 직접 읽기 때문에 추론 중 텍스트 복원 과정이 필요하지 않다.

더 보기
CCTest · Blog
장기 실행 AI 에이전트에 만능 메모리 기반은 없다
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

장기 실행 AI 에이전트에 만능 메모리 기반은 없다

다양한 메모리 저장 방식을 동일한 조건에서 비교한 연구는 최적의 메모리 기반이 작업, 이력 길이, 운영 비용에 따라 달라진다는 점을 보여준다. 단일 방식을 고르기보다 상황별 메모리 라우팅이 중요해진다.

더 보기
CCTest · Blog
ChatGPT Computer History, 데스크톱 사용 기록을 AI 문맥으로 만든다
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

ChatGPT Computer History, 데스크톱 사용 기록을 AI 문맥으로 만든다

OpenAI가 macOS용 ChatGPT 데스크톱 앱에 Computer History 기능을 추가한다. 클릭, 입력, 앱 사용 흐름을 ChatGPT와 Codex가 참고할 수 있게 해 생산성을 높이지만, 개인 작업 기록을 AI에 맡기는 문제도 함께 제기된다.

더 보기
CCTest · Blog
ALiBi 위치 인코딩의 ‘시야 상실’: 긴 문맥 주의가 0이 되는 이유
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

ALiBi 위치 인코딩의 ‘시야 상실’: 긴 문맥 주의가 0이 되는 이유

새 논문은 ALiBi의 선형 위치 바이어스가 부동소수점 정밀도에서 언더플로를 일으켜 많은 attention weight를 0으로 만들 수 있다고 지적한다. 이 경우 일부 attention head는 먼 토큰을 사실상 읽지 못하는 상태가 된다.

더 보기
CCTest · Blog
CAPA: 코딩 어시스턴트는 사용자의 애매한 표현을 기억할 수 있을까
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

CAPA: 코딩 어시스턴트는 사용자의 애매한 표현을 기억할 수 있을까

새 논문은 세션을 넘나드는 개인화된 모호성 적응을 코딩 어시스턴트의 새로운 평가 과제로 제시한다. 핵심은 같은 사용자의 과거 해결 기록을 활용해 반복되는 애매한 요청을 더 적은 확인으로 처리할 수 있는지다.

더 보기
CCTest · Blog
Metis: 파운데이션 모델 안에 들어간 네이티브 메모리
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

Metis: 파운데이션 모델 안에 들어간 네이티브 메모리

Metis는 에이전트 메모리를 외부 검색·저장 파이프라인이 아니라 모델 내부의 지속적으로 변화하는 상태로 다루는 ‘메모리 파운데이션 모델’을 제안한다. 핵심은 과거 정보를 압축된 세션 상태로 유지하고 이후 계산에서 직접 활용하는 것이다.

더 보기
CCTest · Blog
CodeNib: 코드 저장소 컨텍스트를 재사용 가능한 데이터 시스템으로
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

CodeNib: 코드 저장소 컨텍스트를 재사용 가능한 데이터 시스템으로

CodeNib은 코딩 에이전트가 같은 저장소를 반복해서 탐색하는 문제를 다룬다. 커밋별로 어휘, 벡터, 구조 뷰를 만들고 하나의 런타임에서 검색, 심볼 탐색, 제한된 컨텍스트를 제공한다.

더 보기
CCTest · Blog
Agent 메모리는 검색만의 문제가 아니다: ACM이 제시한 컨텍스트 생애주기 관리
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

Agent 메모리는 검색만의 문제가 아니다: ACM이 제시한 컨텍스트 생애주기 관리

이 논문은 Agentic Context Management를 제안하며, 프로덕션 에이전트의 실패 원인이 추론 능력보다 현재 추론 컨텍스트를 관리하지 못하는 데 있는 경우가 많다고 주장한다.

더 보기
CCTest · Blog
ReflectWorld-MM, 프레임이 아닌 엔티티로 비디오를 기억하다
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

ReflectWorld-MM, 프레임이 아닌 엔티티로 비디오를 기억하다

ReflectWorld-MM은 연속되는 영상 속에서 누가 다시 나타났는지, 무엇이 변했는지를 엔티티 단위로 기억하려는 시스템이다. 단순 저장이 아니라, 세계 경험을 구조화해 축적하는 방향으로 비디오 메모리를 재설계했다.

더 보기
CCTest · Blog
RecGPT-V3: 추천 시스템을 ‘과거 재생’에서 ‘기억 기반 의도 이해’로
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

RecGPT-V3: 추천 시스템을 ‘과거 재생’에서 ‘기억 기반 의도 이해’로

RecGPT-V3는 지속적으로 진화하는 사용자 메모리, Semantic IDs 기반 상품 grounding, 잠재 토큰 추론을 결합한 산업용 LLM 추천 시스템이다. 타오바오 ‘Guess What You Like’ 피드 적용 결과 GMV +3.97%, 서빙 리소스 소비 52.4% 감소가 보고됐다.

더 보기
CCTest · Blog
xHC: Transformer 잔차 스트림을 N=16까지 확장하는 방법
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

xHC: Transformer 잔차 스트림을 N=16까지 확장하는 방법

xHC는 Hyper-Connections를 기존의 N=4 한계 너머로 확장해, 잔차 스트림 폭을 대규모 언어 모델 사전학습의 새로운 스케일링 축으로 만들려는 연구입니다. N=16 상태를 유지하면서 일부 스트림만 갱신해 성능과 비용의 균형을 맞춥니다.

더 보기
CCTest · Blog
KV Cache 접목으로 검증된 지식을 재사용하는 동결 소형 모델
메모리·컨텍스트
cctest.ai
메모리·컨텍스트

KV Cache 접목으로 검증된 지식을 재사용하는 동결 소형 모델

새 논문은 검증된 지식을 바이트 단위로 정확한 KV Cache 상태로 저장한 뒤, 이후 추론에 다시 접목하는 방식을 제안한다. 반복 사례에서는 큰 비용 절감이 보고됐지만, 재현성과 ‘추론 능력 향상’의 의미는 신중히 봐야 한다.

더 보기