아티클 목록으로
AI 에이전트

DART-SD, 다중 턴 도구 호출을 토폴로지로 학습한다

약 3분 소요

배경

다중 턴 도구 호출 작업에는 하나의 정답 순서만 존재하지 않는 경우가 많다. 여러 하위 목표가 서로 독립적이라면 에이전트는 A 도구를 먼저 호출한 뒤 B 도구를 사용할 수도 있고, 반대 순서를 택할 수도 있다. 두 경로가 모두 필요한 상태에 도달한다면, 특정 시연 궤적 하나만 정답으로 취급하는 것은 가능한 행동을 지나치게 제한한다.

하지만 기존의 지도 미세 조정이나 궤적 단위 강화학습은 도구 사용 과정을 하나의 선형 시퀀스로 다루는 경우가 많다. ByteDance 연구팀의 DART-SD는 이 문제를 ‘토폴로지 붕괴’로 설명한다. 모델의 선택이 실제로 잘못된 것이 아니라 기록된 순서와 다르다는 이유만으로 패널티를 받으면, 정책의 다양성이 줄고 탐색 중 오류를 복구하는 능력도 약해질 수 있다.

작동 방식

  • 상태 전이 그래프 구성. DART-SD는 Interaction-State Transition Graph, 즉 ISTG를 만든다. 도구 호출과 추론에 따라 달라지는 상호작용 상태를 노드로, 상태 사이의 변화를 엣지로 표현한다. 순서와 무관한 하위 목표가 있으면 경로가 여러 갈래로 나뉘었다가 다시 합쳐지는 다이아몬드 형태가 나타난다.
  • 실패의 핵심 지점 탐지. 자율 롤아웃에서 Critical Topological Breakpoint, 즉 CTB를 식별한다. 이는 단순히 마지막 결과가 실패했다는 표시가 아니라, 해당 단계부터 경로가 성공 가능한 영역에서 벗어나기 시작한 지점이다.
  • 복구 경로 검색. CTB가 정해지면 성공한 실행에서 지지되는 복구 참고 경로를 검색한다. 에이전트가 시연 전체를 처음부터 다시 복사하도록 하는 대신, 현재 상태에서 어떤 행동을 이어가야 하는지 학습시키는 방식이다.
  • 국소적 자기 증류. 학습 손실은 CTB 뒤에서 생성된 복구 단계에만 적용한다. 그 이전의 올바른 추론 접두부는 업데이트로 훼손되지 않도록 보호한다. 핵심은 전체 궤적 강제가 아니라 오류가 발생한 이후에 대한 선택적 수정이다.

의미와 한계

제공된 자료에 따르면 DART-SD는 5개 도구 사용 벤치마크와 2개 모델 규모에서 평가되었으며, 강력한 전체 궤적 SFT·RL 기준선을 일관되게 앞섰다. 또한 Qwen3-8B 학생 모델이 일부 벤치마크에서 훨씬 큰 교사 모델을 능가했다고 보고한다. 다만 구체적인 점수와 과제별 결과, 통계 검증 정보는 소재에 포함되지 않았으므로 개선 폭은 원문 실험표를 통해 확인해야 한다.

DART-SD의 broader한 의미는 에이전트 학습의 대상을 다시 정의했다는 데 있다. 도구 사용은 반드시 하나의 언어 시퀀스가 아니라, 서로 다른 행동 순서와 분기, 수렴, 복구가 존재하는 상태 탐색 과정일 수 있다. 이미 올바른 부분을 보존하면서 문제가 생긴 부분만 수정한다면, 정책의 다양성과 오류 복구 능력을 함께 유지할 가능성이 커진다.

실제 서비스에서도 도구 호출 한 번이 실패했다고 전체 작업을 처음부터 재실행하는 것은 비효율적이다. 현재 환경 상태에서 복구하는 것이 더 현실적이다. 다만 이 방법은 상태 그래프 구성, CTB 탐지, 성공 경로 검색의 품질에 의존한다. 더 길고 개방적인 작업에서 처리 비용과 안정성이 유지되는지는 후속 검증이 필요하다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
PILOT, 장기 에이전트에 실행 중 실시간 교정과 자기 진화를 도입
AI 에이전트
cctest.ai
AI 에이전트

PILOT, 장기 에이전트에 실행 중 실시간 교정과 자기 진화를 도입

PILOT은 에이전트의 자기 개선을 작업 종료 후 분석에서 실행 중 제어로 확장하는 감독자-작업자 하니스를 제안한다. 별도의 감독자는 실행 중인 작업자를 전환하거나 중단할 수 있고, 실행 중 얻은 교훈은 재사용 가능한 기술과 메모리로 축적된다.

더 보기
CCTest · Blog
WikiSkill: 에이전트 경험을 지속 지식으로 바꿔 스킬을 진화시키다
AI 에이전트
cctest.ai
AI 에이전트

WikiSkill: 에이전트 경험을 지속 지식으로 바꿔 스킬을 진화시키다

WikiSkill은 에이전트의 실행 경험, 지속 가능한 위키형 지식베이스, 실행 가능한 스킬을 분리한 뒤 함께 진화시키는 프레임워크다. 여러 모델에서 성능 향상을 보였으며 모델 간 스킬 이전 가능성도 제시했다.

더 보기