실패에서 배우는 AI 에이전트: AED, 5만 건 오류 진단 데이터 공개
들어가며
LLM 에이전트의 실패는 최종 보상이 0이었다는 결과 하나로 끝나지 않습니다. 에이전트가 무엇을 관찰했고, 어떤 행동을 선택했으며, 환경이 어떻게 응답했는지에는 다음 학습에 활용할 수 있는 정보가 담겨 있습니다. 문제는 실패 궤적에서 수정해야 할 의사결정을 찾고, 구체적인 대체 행동이 실제로 효과가 있는지 확인하는 것입니다.
Agent Error Dataset, 즉 AED는 이 문제를 겨냥한 데이터셋입니다. AED에는 9,961개 원천 과제에서 수집한 50,228개의 오류-진단 쌍이 포함됩니다. 데이터 범위는 텍스트 기반 환경 33개, 하네스 계열 19개, 정책 모델 23개입니다. 연구진은 진단 문장만 저장하지 않고 원래의 실행 궤적과 메타데이터도 보존했습니다. 따라서 원래 롤아웃을 다시 실행하지 않아도 설정별 실패를 분석하고 진단을 재수행할 수 있습니다.
AET 파이프라인
연구는 Agentic Error-to-Training, 즉 AET라는 5단계 흐름을 사용합니다. 먼저 실제로 발생한 실패를 수집하고, 관찰 내용과 선택한 행동, 환경의 응답을 바탕으로 문제가 된 판단과 수정안을 생성합니다. 이후 진단 내용을 기록된 증거와 대조합니다. 재실행을 지원하는 환경에서는 같은 체크포인트에서 동일한 실행 조건을 적용해 원래 행동과 수정안을 비교합니다. 마지막으로 데이터는 진단 학습용과 에이전트 행동 회복용으로 나뉩니다.
이처럼 두 목표를 분리하는 것은 중요합니다. 모델이 실패했다는 사실을 아는 것과 실패 원인을 설명하는 것은 다릅니다. 원인을 설명한다고 해서 다음에 올바른 행동을 선택할 수 있는 것도 아닙니다. AED는 실패 이해와 행동 회복을 서로 연결되지만 구별되는 학습 과제로 취급합니다.
주요 결과
- 3,062개의 대응 재실행 쌍에서 첫 수정안은 검증 통과율을 18.4%에서 51.1%로 높였습니다. 상승 폭은 32.7%포인트입니다.
- 별도로 동결한 진단 데이터에서 1,656개 원천 과제로 Qwen3-8B를 미세 조정한 결과, 943개 홀드아웃 사례에서 내부 교사 라벨과의 정확한 단계 일치율이 세 시드 평균 47.2%에서 63.6%로 상승했습니다.
- 같은 비교에서 가장 강한 프롬프트 기반 기준 방법의 점수는 54.7%였습니다. 훈련 데이터 규모를 네 단계로 늘릴 때마다 평균 일치율도 개선됐습니다.
- 단일 시드의 행동 학습 비교에서는 행동 수정만 학습한 방식이 성공 사례만 사용한 방식보다 WebShop-lite에서 6.67%포인트 높은 점수를 기록했습니다.
의미와 한계
AED의 핵심은 데이터 규모만이 아닙니다. 실패 궤적, 진단, 대체 행동, 실행 검증을 하나의 흐름으로 묶어 실패 경험을 후학습에 사용할 수 있는 형태로 바꿉니다. 브라우징이나 도구 사용처럼 중간의 작은 선택이 전체 결과를 좌우하는 과제에서는 단순한 성공·실패 라벨보다 더 유용할 가능성이 있습니다.
다만 결과의 범위는 신중하게 해석해야 합니다. 재실행 기반 평가는 일부 환경에서만 가능하며, 진단 일치율은 논문 내부의 교사 라벨을 기준으로 측정됐습니다. WebShop-lite 행동 학습 비교도 단일 시드 결과입니다. 보지 못한 환경, 더 긴 과제, 다른 도구 생태계로 안정적으로 일반화되는지는 추가 검증이 필요합니다.
그럼에도 AED는 에이전트 학습의 방향을 성공 사례 수집에서 실패 원인과 복구 행동의 체계적 학습으로 확장합니다. 무엇이 잘못됐는지 보존하고, 어떻게 고칠 수 있는지 실행으로 확인하는 접근은 더 견고한 에이전트를 만드는 중요한 데이터 설계 원칙이 될 수 있습니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…