아티클 목록으로
AI 에이전트

IterSynth, 역할 분리로 딥서치 에이전트를 다시 설계하다

약 3분 소요

들어가며

딥서치는 웹 검색을 여러 번 실행하는 작업만을 뜻하지 않는다. 복잡한 질문을 작은 문제로 나누고, 아직 부족한 정보가 무엇인지 판단하며, 다음 검색어를 만들고, 흩어진 근거를 신뢰할 수 있는 답변으로 통합해야 한다. 기존 ReAct형 에이전트는 이 모든 역할을 하나의 정책에 동시에 맡기는 경우가 많다. 검색이 길어질수록 과거 추론과 검색 결과도 문맥에 계속 쌓이기 때문에, 유용한 단서가 잡음 속에 묻힐 수 있다. IterSynth는 역할 분담과 상태 표현을 함께 바꾸는 접근을 제안한다.

두 역할, 하나의 모델

IterSynth는 별도의 두 모델을 사용하는 대신 동일한 파라미터 집합을 두 역할로 번갈아 실행한다.

  • Planner:현재의 압축된 상태를 읽고 해결되지 않은 정보 요구를 파악해 다음 하위 검색어를 만든다.
  • Synthesizer:새로 검색한 근거를 검토하고 중요한 내용을 진화하는 요약에 반영한다.

요약은 검색이 끝난 뒤 답변을 줄이는 보조 기능이 아니다. 탐색을 이어 가는 영속 상태다. 다음 Planner는 전체 원시 기록이 아니라 제한된 작업 공간에서 재구성된 요약을 바탕으로 판단한다. 이 방식은 문맥 증가로 인한 잡음을 줄이고, 계획과 근거 통합을 서로 다른 책임으로 구분한다.

RDPO가 제공하는 역할별 학습 신호

새로운 실행 구조를 안정적으로 학습하려면 보상 설계도 바뀌어야 한다. 연구팀은 이를 위해 Role-Decoupled Policy Optimization, 즉 RDPO를 제안했다. 최종 답변의 결과 보상에 턴 단위 평가 기준을 더하고, Planner와 Synthesizer에 대해 그룹 상대적 어드밴티지를 독립적으로 계산한다. 따라서 특정 검색어가 정보 수집에 기여했는지, 특정 요약 갱신이 상태를 개선했는지를 각 역할에 더 가까운 신호로 학습할 수 있다.

결과와 해석

GAIA text-only, 여러 xBench 설정, BrowseComp, BrowseComp-ZH 등의 과제에서 IterSynth-8B는 평균 50.7점을 기록했다. 이는 이전 8B 이하 에이전트 가운데 가장 강한 결과보다 4.2포인트 높은 수치다. 학습 절제 실험에서는 SFT가 44.1점, 결과 보상만 사용한 GRPO가 48.9점, RDPO가 50.7점으로 이어졌다. 학습되지 않은 Planner로 교체했을 때 성능이 크게 하락했다는 결과는 역할 분리가 단순한 프롬프트 형식 이상의 효과를 낸다는 점을 뒷받침한다.

요약 기반의 제한된 문맥은 검색 라운드를 12회 이상에서 약 78회로 줄였고, 문맥 한도 소진 비율은 5% 미만으로 보고됐다. 동등한 두 모델 배포와 비교하면 추론 시간도 약 1315% 감소했다. 또한 Claude-4.5-Opus와 DeepSeek-V3.1에서는 ReAct보다 높은 제로샷 결과가 관찰됐다.

IterSynth의 핵심 의미는 에이전트의 기억을 전체 기록에서 수정 가능한 작업 요약으로 전환했다는 데 있다. 이는 문맥 비용을 낮추고 장기 탐색 에이전트의 학습과 배포를 단순화할 가능성이 있다. 다만 요약 과정에서 세부 정보가 빠지거나 오류가 누적될 수 있으므로, 앞으로는 근거 추적성과 요약의 충실도까지 함께 검증해야 한다.

출처:Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
AI 에이전트 팀이 ‘함께 추론하는 방법’을 스스로 배운다
AI 에이전트
cctest.ai
AI 에이전트

AI 에이전트 팀이 ‘함께 추론하는 방법’을 스스로 배운다

Self-Organizing Agent Teams(SAT)는 고정된 구성의 AI 에이전트들이 과거 협업 경험을 바탕으로 역할, 대화 단계, 참여 방식, 정보 흐름을 학습하도록 합니다. 수학·물리 벤치마크에서 단일 에이전트와 이상적인 답변 라우터보다 높은 성능이 보고됐습니다.

더 보기
CCTest · Blog
VHD-Play, 해를 구한 메커니즘으로 검증 가능한 에이전트 RL 환경 생성
AI 에이전트
cctest.ai
AI 에이전트

VHD-Play, 해를 구한 메커니즘으로 검증 가능한 에이전트 RL 환경 생성

VHD-Play는 환경을 먼저 만들고 평가 규칙을 나중에 붙이는 대신, 해를 구한 수학적 메커니즘을 바탕으로 에이전트 환경을 생성하는 방법을 제안합니다. 상태 변화와 숨겨진 매개변수, 지연된 결과를 포함한 장기 상호작용 학습을 지원합니다.

더 보기