Context Language Models: 모델이 스스로 문맥을 관리하는 방법
들어가며
컨텍스트 윈도우가 커진다고 해서 기억이 자동으로 좋아지는 것은 아니다. 장시간 웹 탐색, 코딩, 협업을 수행하는 에이전트에게 더 어려운 문제는 어떤 정보를 남기고, 무엇을 압축하며, 무엇을 버릴지 결정하는 일이다. 현재 많은 시스템은 이 작업을 외부 하네스, 요약기, 검색기 또는 사람이 설계한 규칙에 맡긴다. Context Language Models(CLM)는 이 판단을 언어 모델 자체에 맡기려는 접근이다.
문맥을 파일처럼 다루기
CLM의 핵심 아이디어는 문맥을 하나의 파일로 표현하고, 모델이 그 파일을 제한 없이 갱신하도록 하는 것이다. 모델은 과거 기록을 읽기만 하는 것이 아니라, 작업이 진행되는 동안 정보를 재구성하고 다시 쓰며 유지할 수 있다. 따라서 문맥 관리는 고정된 잘라내기·요약·검색 규칙이 아니라 모델 행동의 일부가 된다.
이 추상화는 멀티에이전트 시스템에도 적용된다. 각 에이전트가 별도의 문맥 파일을 유지하면 서로 다른 작업 상태와 정보 경계를 관리할 수 있다. 또한 모든 문맥 관리 정책을 외부 컨트롤러에 넣는 대신, 모델의 인컨텍스트 학습이나 파라미터 학습을 통해 전략을 습득할 가능성도 생긴다.
보고된 결과와 최적화
논문 초록에 따르면 기존 모델을 활용해 제로샷으로 구축한 CLM은 여러 평가에서 기존 문맥 관리 전략을 앞섰다.
- BrowseComp-Plus에서는 정확도가 11.4% 높고 FLOPs는 21.5% 적었다.
- 12시간 EdgeBench에서는 점수가 5% 상승했으며 FLOPs는 59% 감소했다.
- 24시간 다중 저장소 agent-swarm 과제에서는 동일한 계산량으로 개선 폭이 65% 더 컸다.
연구진은 추가적인 학습 방법도 살펴봤다. 표준 스킬 최적화 루프를 사용하면 문맥 관리용 자연어 지시를 개선할 수 있으며, 초록은 한 문맥 관리 과제의 미지 데이터에서 최대 35.9포인트의 성능 향상과 계산량 감소를 보고한다. 온라인 강화학습은 Qwen3.5-9B의 BrowseComp-Plus 성능을 47.6% 높이면서 FLOPs를 12% 줄였다.
서비스 단계에서는 CLM에 맞춘 Suffix Cache Reuse도 제안됐다. 동일한 성능 조건에서 표준 SGLang과 비교하면 서버 측 계산량을 추가로 35% 줄일 수 있다는 설명이다. 즉, 모델에 문맥 갱신 권한을 부여한다고 해서 추론 비용이 반드시 같은 비율로 증가하는 것은 아니다.
의미와 남은 과제
CLM은 모델과 에이전트 프레임워크 사이의 역할을 다시 나눈다. 외부 시스템이 모든 작업에 동일한 메모리 정책을 강제하는 대신, 모델이 과제에 맞춰 정보의 구조를 바꿀 수 있다. 이는 장기 실행 에이전트, 코딩 도구, 멀티에이전트 협업을 위한 공통 기반이 될 가능성이 있다.
다만 제공된 자료에는 각 벤치마크의 전체 설정, 파일 갱신의 구체적인 방식, 과제별 오류 분포가 담겨 있지 않다. 따라서 CLM을 장기 기억과 신뢰성 문제를 이미 해결한 최종 해법이라기보다, 가능성을 보여준 시스템 설계로 보는 편이 적절하다. 중요한 정보의 오삭제를 막는 방법, 문맥 변경을 감사하는 방식, 더 복잡한 환경에서의 안정성은 앞으로 검증해야 할 과제다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…