WideSWE, 코딩 에이전트의 저장소 간 협업 능력을 시험하다
들어가며
코딩 에이전트 평가는 개별 이슈 해결에서 장기 개발 작업 수행으로 확장되고 있습니다. 하지만 많은 벤치마크는 여전히 하나의 저장소 안에서 문제를 해결하도록 설계되어 있습니다. 실제 소프트웨어 생태계에서는 기능 추가나 버그 수정이 핵심 라이브러리, 클라이언트, 통합 프로젝트, 테스트 저장소 등에 동시에 영향을 줄 수 있습니다. 한 곳만 수정하면 해당 저장소에서는 그럴듯해 보여도 전체 시스템의 동작은 보장되지 않습니다.
WideSWE는 이런 저장소 간 협업 능력을 측정하기 위해 제안된 평가 프레임워크입니다. 연구진은 103개 소프트웨어 생태계의 변경 내역을 수집하고 검토해 실제 개발에 기반한 120개 과제를 만들었습니다. 과제는 버그 수정 60개와 기능 개발 60개로 균형을 이룹니다. 프롬프트는 관련 이슈와 Pull Request를 바탕으로 구성했으며, 숨은 테스트도 다양한 정답 구현을 허용하도록 조정하면서 필수 동작과 회귀 검증은 유지했습니다.
핵심 내용
- 평가 단위가 단일 저장소에서 생태계로 넓어졌다. 에이전트는 요청의 영향을 받는 저장소를 모두 찾아내고 서로 호환되는 변경을 적용해야 합니다.
- 실제 개발 시나리오를 반영한다. 과제는 기능과 버그 수정으로 나뉘며, 벤치마크만을 위해 만든 고립된 문제에 한정되지 않습니다.
- 완전한 과제 수행은 여전히 어렵다. 7개 에이전트 설정의 전체 성공률은 10.83%에서 42.50%였습니다. 가장 높은 결과는 Codex CLI와 GPT-5.6-sol 조합에서 나왔습니다.
- 문제는 코드 작성에만 있지 않다. 필요한 저장소를 찾지 못하거나, 필요한 변경을 알아도 끝까지 수행하지 못하거나, 관련 저장소를 수정하고도 전체 요구사항을 충족하지 못하는 경우가 나타났습니다.
- 실행 방식도 중요하다. 저장소별 독립 실행은 누락된 작업을 보완하는 데 유리했지만, 이미 실패한 구현을 바로잡는 데는 효과가 제한적이었습니다. 공동 실행은 관련 저장소의 정보를 구현과 검증에 활용할 수 있었습니다.
의미와 영향
WideSWE는 로컬 코드 편집 능력과 소프트웨어 생태계 전체를 다루는 개발 능력 사이에 큰 차이가 있음을 보여줍니다. 저장소 간 작업에는 전체 변경 계획, 의존성 이해, 인터페이스 동기화, 여러 프로젝트를 아우르는 검증이 필요합니다. 따라서 단일 저장소 과제를 여러 개 합친 것만으로는 충분하지 않습니다. 에이전트가 한 프로젝트의 변경이 다른 프로젝트에 어떤 영향을 주는지 파악해야 하기 때문입니다.
이 결과는 에이전트 워크플로 설계에도 시사점을 줍니다. 저장소를 분리하면 실행을 관리하기 쉽지만, 계획과 디버깅에 필요한 맥락을 잃을 수 있습니다. 관련 정보를 공유하고, 작업 상태를 지속적으로 추적하며, 저장소를 넘나드는 회귀 검증을 수행하는 방식이 복잡한 개발에 더 적합할 가능성이 있습니다.
WideSWE의 가치는 새로운 성공률을 제시하는 데 그치지 않습니다. 작업 누락, 미완료 변경, 불완전한 동작 구현처럼 기존 평가에서 놓치기 쉬웠던 실패를 명시적인 측정 대상으로 만들었다는 점에 의미가 있습니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…