AI 코딩 에이전트는 코드를 늘렸지만 소프트웨어는 늘리지 못했다
AI 코딩 에이전트는 소프트웨어 팀이 코드를 만드는 방식을 바꾸고 있다. 그러나 코드를 더 빨리 생성한다고 해서 소프트웨어를 더 많이, 더 빠르게 출시할 수 있는 것은 아니다. 하버드대 연구자 Fiona Chen과 James Stratton의 분석에 따르면, 기업은 AI 에이전트 도입 후 훨씬 많은 코드를 만들었지만 완성된 소프트웨어의 양이 뚜렷하게 증가했다는 증거는 거의 없었다.
연구가 측정한 변화
연구진은 Jellyfish가 집계한 2021년부터 2026년 3월까지 약 3억 건의 엔지니어링 작업 데이터를 분석했다. 자료에는 700곳이 넘는 소프트웨어 개발 기업과 70만 명 이상의 직원이 포함됐다. 기업이 AI 코딩 보조 도구나 보다 자율적인 코딩 에이전트를 도입하기 전후의 개발 지표를 비교하는 방식이었다.
주요 결과는 다음과 같다.
- AI 코딩 에이전트 도입 후 생성된 코드 줄 수가 평균 30% 증가했다.
- 전체 커밋은 20%, 풀 리퀘스트는 23% 늘었다.
- Jira 등에서 추적하는 이슈와 에픽의 해결률은 통계적으로 유의미하게 변하지 않았다.
- 풀 리퀘스트 제출부터 코드베이스 병합까지 걸리는 평균 검토 시간이 49% 증가했다.
- 수정 요청을 받는 풀 리퀘스트의 비율은 거의 두 배가 됐고, 풀 리퀘스트당 댓글 수는 35% 늘었다.
- 코드 검토에 참여하는 직원의 비율은 14% 상승했다.
이 결과는 코드 생성 단계의 속도 향상이 전체 개발 과정의 처리량 향상으로 이어지지 않았음을 보여준다. 에이전트가 더 많은 변경을 만들어낼수록 팀은 그 내용을 이해하고 테스트하고 통합하고 승인해야 한다. 생성 코드의 품질과 맥락 이해가 완전히 안정되지 않은 상황에서는 추가 산출물이 완성된 기능보다 검토와 재작업으로 나타나기 쉽다.
인간 검토가 새로운 병목
소프트웨어 개발은 단순한 코드 작성 작업이 아니다. 변경 사항은 기존 아키텍처와 테스트, 보안 요구사항, 제품 목표에 맞아야 실제 배포 가치가 생긴다. 이번 연구는 AI 에이전트가 구현에 걸리는 시간을 줄일 수는 있지만, 그 뒤에 이어지는 조정과 검증을 자동으로 없애지는 못한다는 점을 시사한다.
AI 기반 코드 검토도 아직 이 격차를 충분히 메우지 못했다. 2026년 3월까지 조사 대상 기업의 약 80%가 어떤 형태로든 AI 코드 검토를 사용했지만, AI 에이전트가 작성한 검토 댓글은 전체의 23.3%, 담당한 풀 리퀘스트는 10.8%에 그쳤다. 대부분의 검토는 여전히 사람이 수행한 셈이다. 또한 연구진은 AI 에이전트 도입 이후 기업의 전체 활성 인력에 유의미한 변화가 있었는지도 확인하지 못했다. 따라서 이번 결과만으로 AI가 소프트웨어 엔지니어를 광범위하게 대체했다고 보기는 어렵다.
기업이 봐야 할 지표
이 연구가 코딩 에이전트의 가치가 없다는 뜻은 아니다. 프로토타입 제작, 반복 작업, 범위가 명확한 구현에서는 초기 산출 시간을 줄일 수 있다. 다만 코드 줄 수, 커밋 수, 풀 리퀘스트 수만으로 생산성을 판단하면 활동량 증가를 소프트웨어 전달 개선으로 착각할 수 있다. 완성 기능, 결함, 재작업, 검토 부담, 전체 출시 기간을 함께 측정해야 한다.
분석 데이터는 2026년 3월까지이며, 에이전트 성능과 팀의 활용 방식은 계속 변하고 있다. 적절한 작업 선별, 강화된 테스트, 검토 자동화, 명확한 책임 분담이 자리 잡으면 현재의 병목은 완화될 수 있다. 그러나 현재 시점의 결론은 분명하다. AI 에이전트는 코드 공급량은 늘렸지만 소프트웨어 생산 과정 전체의 처리 능력을 자동으로 높이지는 못했다. 중요한 것은 에이전트가 더 많이 쓰게 하는 일이 아니라, 팀이 그 결과물을 전체 개발 흐름에서 제대로 소화하도록 만드는 일이다.
출처: Ars Technica AI
댓글
로그인 상태 확인 중…
댓글 불러오는 중…