아티클 목록으로
AI 에이전트

X-Tree: 재사용 가능한 경험을 AI 에이전트 학습에 넣다

약 4분 소요

들어가며

다단계 AI 에이전트는 개별 행동을 수행할 수 있어도, 한 작업에서 배운 절차를 다른 작업에 안정적으로 적용하는 데 어려움을 겪습니다. 일반적인 SFT와 강화학습은 궤적을 평면적인 행동 스트림으로 다루며, 각 토큰이나 행동을 비슷한 수준에서 학습합니다. 그 결과 “두 필드를 입력하고 제출하기”나 “특정 장소로 이동해 물체 가져오기” 같은 반복 절차가 작업마다 다시 학습됩니다.

X-Tree는 기존 궤적에 숨어 있는 이런 계층 구조를 복원해 학습에 직접 활용하는 방법입니다. 이름은 재사용 가능한 경험 트리(Reusable eXperience Tree)를 뜻합니다.

토크나이저처럼 스킬을 발견하다

X-Tree는 LLM에 스킬 설명을 작성하도록 요청하지 않습니다. 대신 서브워드 토크나이저와 유사한 통계적 병합 절차를 사용합니다. 먼저 원시 행동을 비교 가능한 형태로 정규화합니다. 날짜 입력이나 버튼 클릭 같은 행동 유형은 유지하고, 페이지별 요소 ID와 구체적인 값은 슬롯으로 분리합니다. 그러면 서로 다른 페이지에서 발생한 유사 행동을 같은 행동 유형으로 볼 수 있습니다.

다음으로 인접한 행동 구간의 재사용 가치를 평가합니다. 단순한 출현 빈도뿐 아니라 병합된 구간의 길이와 성공한 에피소드에서의 등장 빈도도 고려합니다. 궤적의 중복을 줄이는 이점이 비용보다 클 때만 구간을 병합합니다. 짧은 행동들이 재사용 가능한 하위 절차가 되고, 이들이 다시 더 높은 수준의 절차를 구성합니다.

예를 들어 두 필드 입력과 제출을 하나의 노드로 만들 수 있습니다. 여기에 앞선 탐색 행동을 결합하면 날짜 범위로 표를 필터링하는 상위 절차가 됩니다. 이 과정은 데이터 정규화와 계수에 기반하므로 결정적이고 감사 가능하며, 별도의 LLM 호출도 필요하지 않습니다.

세 가지 학습 방식

논문은 X-Tree를 세 가지 학습 설정에 통합했습니다.

  • 오프라인 강화학습: 트리의 각 노드를 학습 인스턴스로 사용해 원시 행동열이 아니라 프로그램 수준의 경험을 학습합니다.
  • 온라인 RLVR: 가치 있고 재사용 가능한 스킬을 수행했을 때 적응형 스킬 보너스를 제공해 행동을 강화합니다.
  • 온폴리시 자기 증류: 경험 트리를 교사 모델만 볼 수 있는 특권적 문맥으로 제공해 궤적에서 상위 수준의 구조를 추출합니다.

이는 LLM이 작성한 스킬을 프롬프트에만 넣는 방식과 다릅니다. 프롬프트 기반 스킬은 현재 문맥에서 도움을 줄 수 있지만, 모델 가중치에 들어가지 않으며 검색이나 추가 문맥이 없을 때 일반화되지 않을 수 있습니다. X-Tree는 반복되는 경험 자체를 학습 신호로 바꾸려 합니다.

결과와 의미

WebArena, ScienceWorld, WebShop을 세 가지 모델 규모에서 평가한 결과, 동일한 데이터와 학습 예산 조건에서 표준 학습 방식보다 높은 성능을 보였습니다. 최대 개선 폭은 WebArena 성공률 4.5%포인트, ScienceWorld 5.8%포인트, WebShop 성공률 4.1%포인트였습니다. 통제된 분석에서는 단순히 문맥을 늘린 효과가 아니라, 경험 트리 구조와 세 가지 통합 방식이 성능 향상에 기여한 것으로 나타났습니다.

이 연구의 핵심 의미는 수작업으로 설계한 프롬프트 스킬을 에이전트 데이터에서 자동으로 발견되는 학습 대상으로 전환했다는 점입니다. 수집 비용이 높은 궤적을 프로그램 단위로 나누면 한 번의 경험을 더 효율적으로 활용할 수 있으며, 오프라인 데이터 정제, 보상 설계, 능력 전이에 공통으로 적용할 수 있습니다. 다만 효과는 행동 정규화의 품질과 성공 궤적의 충분성에 의존합니다. 페이지 문맥에 강하게 묶인 절차를 어떻게 추상화할지는 여전히 남은 과제입니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
LLM 에이전트는 왜 철회된 사용자 지시를 계속 따를까
AI 에이전트
cctest.ai
AI 에이전트

LLM 에이전트는 왜 철회된 사용자 지시를 계속 따를까

새 연구는 사용자가 바꾸거나 철회한 요구사항이 최종 답변과 도구 실행에 계속 영향을 미치는 현상을 측정 가능한 ‘의도 드리프트’로 정의했다. IntentFlux와 StateForge 평가 결과, 명시적인 상태 관리는 도움이 되지만 단일 턴 수준을 완전히 회복하지는 못했다.

더 보기
CCTest · Blog
검색 에이전트의 ‘상호 부정행위’: CrossFit이 자가 진화 오류를 줄이는 방법
AI 에이전트
cctest.ai
AI 에이전트

검색 에이전트의 ‘상호 부정행위’: CrossFit이 자가 진화 오류를 줄이는 방법

자가 진화 검색 에이전트는 서로의 같은 오류를 정답처럼 강화해 내부 보상만 높일 수 있다. CrossFit은 학습 데이터와 평가 경로의 출처를 분리해 이런 피드백 고리를 약화한다.

더 보기