IterSynth, 역할 분리로 딥서치 에이전트를 다시 설계하다
들어가며
딥서치는 웹 검색을 여러 번 실행하는 작업만을 뜻하지 않는다. 복잡한 질문을 작은 문제로 나누고, 아직 부족한 정보가 무엇인지 판단하며, 다음 검색어를 만들고, 흩어진 근거를 신뢰할 수 있는 답변으로 통합해야 한다. 기존 ReAct형 에이전트는 이 모든 역할을 하나의 정책에 동시에 맡기는 경우가 많다. 검색이 길어질수록 과거 추론과 검색 결과도 문맥에 계속 쌓이기 때문에, 유용한 단서가 잡음 속에 묻힐 수 있다. IterSynth는 역할 분담과 상태 표현을 함께 바꾸는 접근을 제안한다.
두 역할, 하나의 모델
IterSynth는 별도의 두 모델을 사용하는 대신 동일한 파라미터 집합을 두 역할로 번갈아 실행한다.
- Planner:현재의 압축된 상태를 읽고 해결되지 않은 정보 요구를 파악해 다음 하위 검색어를 만든다.
- Synthesizer:새로 검색한 근거를 검토하고 중요한 내용을 진화하는 요약에 반영한다.
요약은 검색이 끝난 뒤 답변을 줄이는 보조 기능이 아니다. 탐색을 이어 가는 영속 상태다. 다음 Planner는 전체 원시 기록이 아니라 제한된 작업 공간에서 재구성된 요약을 바탕으로 판단한다. 이 방식은 문맥 증가로 인한 잡음을 줄이고, 계획과 근거 통합을 서로 다른 책임으로 구분한다.
RDPO가 제공하는 역할별 학습 신호
새로운 실행 구조를 안정적으로 학습하려면 보상 설계도 바뀌어야 한다. 연구팀은 이를 위해 Role-Decoupled Policy Optimization, 즉 RDPO를 제안했다. 최종 답변의 결과 보상에 턴 단위 평가 기준을 더하고, Planner와 Synthesizer에 대해 그룹 상대적 어드밴티지를 독립적으로 계산한다. 따라서 특정 검색어가 정보 수집에 기여했는지, 특정 요약 갱신이 상태를 개선했는지를 각 역할에 더 가까운 신호로 학습할 수 있다.
결과와 해석
GAIA text-only, 여러 xBench 설정, BrowseComp, BrowseComp-ZH 등의 과제에서 IterSynth-8B는 평균 50.7점을 기록했다. 이는 이전 8B 이하 에이전트 가운데 가장 강한 결과보다 4.2포인트 높은 수치다. 학습 절제 실험에서는 SFT가 44.1점, 결과 보상만 사용한 GRPO가 48.9점, RDPO가 50.7점으로 이어졌다. 학습되지 않은 Planner로 교체했을 때 성능이 크게 하락했다는 결과는 역할 분리가 단순한 프롬프트 형식 이상의 효과를 낸다는 점을 뒷받침한다.
요약 기반의 제한된 문맥은 검색 라운드를 12회 이상에서 약 78회로 줄였고, 문맥 한도 소진 비율은 5% 미만으로 보고됐다. 동등한 두 모델 배포와 비교하면 추론 시간도 약 1315% 감소했다. 또한 Claude-4.5-Opus와 DeepSeek-V3.1에서는 ReAct보다 높은 제로샷 결과가 관찰됐다.
IterSynth의 핵심 의미는 에이전트의 기억을 전체 기록에서 수정 가능한 작업 요약으로 전환했다는 데 있다. 이는 문맥 비용을 낮추고 장기 탐색 에이전트의 학습과 배포를 단순화할 가능성이 있다. 다만 요약 과정에서 세부 정보가 빠지거나 오류가 누적될 수 있으므로, 앞으로는 근거 추적성과 요약의 충실도까지 함께 검증해야 한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…