WEFT: 도구 사용 후학습을 시스템 전체로 확장하다
들어가며
언어 모델이 도구를 사용하도록 학습시키는 일은 API나 실행 가능한 환경을 더 많이 제공하는 것만으로 해결되지 않습니다. 작업이 실제로 수행 가능한지, 에이전트 하네스가 적절한 상호작용을 제공하는지, 평가기가 결과를 정확히 판정하는지도 중요합니다. 환경만 확장하면 모델의 정책 오류가 아닌 문제까지 모델의 한계로 잘못 해석할 수 있습니다.
WEFT(Whole-system Evolution For Tool-use Post-training)는 이 문제를 해결하기 위해 환경, 작업, 에이전트 하네스, 평가기를 하나의 에이전트 상호작용 시스템으로 묶습니다. 즉, 도구 사용 후학습을 단순한 환경 규모 확장이 아니라 전체 시스템의 진화 문제로 다룹니다.
핵심 방법
- 실행 가능한 상호작용을 넓힌다. WEFT는 8,172개의 실행 가능한 MCP, 64,755개의 도구, 41,695개의 인증된 원자 작업을 구축한 뒤 이를 11,884개의 작업으로 조합합니다. 작업 길이의 중앙값은 20개 원자 작업 턴이며, 여러 MCP와 도메인을 가로지르는 작업도 포함됩니다.
- 상호작용 방식을 다양화한다. 같은 작업을 완성된 요구사항으로 제시해 자율 실행하게 하거나, 시뮬레이션 사용자가 단계적으로 안내하도록 만들 수 있습니다. ReAct, OpenClaw, Hermes 같은 네이티브 하네스도 활용합니다. 작업 집합을 고정한 비교에서 Agentic과 SimUser 데이터를 섞자 WEFT-35B-A3B가 평균 3.18포인트 향상됐고, 하네스를 추가하자 보고된 벤치마크에서 평균 9.71포인트의 추가 향상이 나타났습니다.
- 실행 결과로 시스템을 고친다. 실패한 롤아웃이 항상 정책 실패인 것은 아닙니다. WEFT는 도구 호출 기록, 체크포인트 결과, 데이터베이스와 작업공간의 변화를 분석해 정책·환경·작업·검증기 중 어느 요소에 문제가 있는지 구분합니다. 세 차례의 자기진화 이후 선택된 교사 궤적의 도구 호출 오류율은 1.76%에서 0.96%로 낮아졌고, 세 벤치마크에서는 각각 5.25, 4.33, 3.65포인트의 향상이 보고됐습니다.
- 긴 학습 과정을 안정화한다. Prefix-preserving sampling은 이미 검증된 진행 상황을 유지하고, 전체 궤적을 버리지 않은 채 실패한 원자 작업부터 다시 시도합니다. 원자 턴 단위 신용 할당은 같은 이력과 상태에서 생성된 후보를 비교해 현재 작업에 학습 신호를 집중합니다. 강화학습 전에는 언어 모델로 작업과 실행 가능한 검증기의 일치 여부를 필터링하지만, RL에는 실행 가능한 보상을 계속 사용합니다.
- 상태를 격리하고 복구한다. MegaMCP는 재사용 가능한 도구 서비스를 에이전트 샌드박스 외부에서 운영하면서 각 롤아웃의 데이터베이스와 작업공간을 독립적이고 복구 가능하게 유지합니다. 1,000개 작업 실험에서 샌드박스 업로드 용량은 773.5 MiB에서 34.8 MiB로 감소했습니다.
의미와 영향
WEFT의 핵심 시사점은 도구 사용 후학습이 환경의 개수만으로 결정되지 않는다는 것입니다. 작업의 실행 가능성, 대화 설계, 하네스 동작, 평가기의 정확도가 함께 학습 신호의 품질을 결정합니다.
여러 도구와 의존 단계가 포함된 장기 워크플로에서는 이미 완료한 부분을 보존하고 상태를 복원할 수 있는지가 특히 중요합니다. 실행 기록은 정책 학습용 데이터일 뿐 아니라, 어떤 시스템 요소를 개선해야 하는지 알려주는 진단 자료이기도 합니다. 다만 보고된 결과는 논문의 모델·작업·벤치마크에 기반하므로, 다른 모델이나 실제 운영 환경에서의 일반화 가능성은 추가 검증이 필요합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…