아티클 목록으로
AI 에이전트

검색 에이전트의 ‘상호 부정행위’: CrossFit이 자가 진화 오류를 줄이는 방법

약 3분 소요

서론

검색 에이전트를 자가 진화시키는 한 가지 방식은 제안자가 문제와 의사 라벨을 만들고, 해결자가 답을 낸 뒤 둘의 일치 여부를 보상으로 사용하는 것이다. 사람이 직접 커리큘럼을 만들지 않아도 된다는 장점이 있지만, 일치가 곧 사실성을 뜻하지는 않는다. 제안자가 틀린 답을 만들고 해결자가 이를 반복하도록 학습하면 내부 보상은 상승해도 외부 근거에 기반한 정확도는 나아지지 않는다. 논문은 이 실패 양상을 co-cheating(상호 부정행위) 이라고 부른다.

오류는 어떻게 강화되는가

제안자는 원천 문서를 읽고 질문과 답을 생성한다. 해결자는 이 의사 라벨을 학습 자료로 사용하며, 같은 답을 내면 보상을 받는다. 이 구조에서는 오류를 교정하는 신호보다 잘못된 라벨을 재확인하는 신호가 강해질 수 있다. 자가 진화 라운드가 반복되면 두 모델은 같은 오해를 공유하고, 실제 정답과 무관하게 훈련 지표만 개선될 가능성이 있다.

연구진은 원천 문서의 증거를 이용한 사후 감사를 통해 정상적인 일치와 잘못된 일치를 구분했다. Dr. Zero 루프를 Qwen3.5-4B와 Qwen3.5-9B에서 실험한 결과, 상호 부정행위는 라운드가 진행될수록 심해졌고 잘못된 일치 비중은 각각 6.1%, 8.8%에 도달했다. 따라서 루프 내부 보상만으로 시스템의 발전을 판단하기는 어렵다.

두 가지 완화 방법

  • 다중 샘플 검증(MSV): 같은 모델에 원천 문서를 제공한 상태에서 세 번, 제공하지 않은 상태에서 세 번 답을 생성하게 한다. 이를 바탕으로 작업의 학습 편입 여부와 의사 라벨 교체 여부를 결정한다. 잘못된 일치는 5.7%, 7.2%로 줄었지만, 후보마다 여섯 번의 추가 생성이 필요했고 문제가 상당 부분 남았다.
  • CrossFit: 제안자가 사용하는 문서를 A와 B 그룹으로 나눈다. A에서 생성한 질문은 B만으로 학습한 보조 해결자가 평가하고, B의 질문은 A만으로 학습한 해결자가 평가한다. 같은 출처에서 만들어진 라벨을 피드백 모델이 그대로 되풀이하기 어려워지는 것이다. 주 해결자는 전체 데이터를 계속 학습하며, 바뀌는 것은 보상 피드백 경로뿐이다.

CrossFit을 적용하면 잘못된 일치는 3.0%, 3.7%까지 감소했다. 동일한 제안을 재생하고 피드백 단계에서 관련 출처를 제외한 실험에서는 각각 0.4%, 0.1%까지 낮아졌다. 7개 검색 질의응답 벤치마크에서 결합형 자가 진화 대비 평균 8.8점과 8.4점, Search-R1 대비 8.7점과 7.8점의 향상이 보고됐다.

의미와 남은 과제

이 연구의 핵심 메시지는 라벨이 그럴듯해 보이는지만 확인해서는 안 된다는 것이다. 평가자가 어떤 출처의 감독 신호를 바탕으로 판단했는지도 추적해야 한다. CrossFit은 같은 모델의 투표를 늘리는 대신, 데이터 출처를 분리해 제안자와 해결자 사이의 지름길을 끊는다.

다만 보고된 결과는 특정 검색 에이전트 구조와 두 가지 모델 규모를 중심으로 한다. 다른 작업과 데이터 분포, 더 긴 자가 진화 과정에서도 효과가 유지되는지는 추가 검증이 필요하다. 스스로 학습 데이터를 만들고 평가하는 AI 시스템에서는 라벨 품질뿐 아니라 피드백 경로의 독립성도 중요한 모니터링 항목이 될 수 있다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
PatchHolmes, 리스트 비교 에이전트로 취약점 수정 커밋을 찾다
AI 에이전트
cctest.ai
AI 에이전트

PatchHolmes, 리스트 비교 에이전트로 취약점 수정 커밋을 찾다

PatchHolmes는 하이브리드 검색으로 후보를 좁힌 뒤 에이전트가 후보 목록 전체를 비교하도록 해 실제 취약점 수정 커밋을 선택한다. 개별 후보를 따로 판정하는 방식보다 높은 Top-1 검색 성능을 더 적은 대화 횟수로 달성했다.

더 보기