Harness-of-Harness: 코딩 에이전트를 지속적 소프트웨어 개발로 이끄는 방법
들어가며
대규모 언어 모델에게 코드를 작성하게 해 실행 가능한 결과를 얻는 일은 더 이상 유일한 난제가 아닙니다. 더 어려운 문제는 사람의 개입 없이 며칠 동안 개발을 이어가면서 버그를 고치고, 기능을 추가하고, 프로젝트의 맥락을 유지해 실제로 사용할 수 있는 소프트웨어를 완성하는 것입니다. 논문이 제안한 Harness-of-Harness(HoH)는 이러한 장기 자율 개발을 위한 프레임워크입니다. 새로운 기반 모델을 만드는 대신, 기존 코딩 에이전트 하네스의 실행 방식을 조직하고 관리합니다.
핵심 설계
HoH는 계획, 코딩, 테스트를 반복하는 루프를 구성하고, 반복 사이에 독립 평가를 배치합니다. 주요 아이디어는 다음과 같습니다.
- 수정과 기능 확장을 함께 추진: 기존 결함을 고치는 동시에 제품의 새로운 능력도 추가해, 매번 문제 해결에만 머무르지 않도록 합니다.
- 작고 검증 가능한 단위로 개발: 범위가 분명한 결과물을 단계적으로 만들고, 장기 작업에서 목표가 흐려지는 위험을 줄입니다.
- 구현 테스트와 독립 평가를 분리: 개발 중 테스트는 작업 피드백에 사용하고, 독립 평가는 결과물이 요구사항을 실제로 충족하는지 확인합니다.
- 작업 방식보다 결과를 제약: 에이전트가 계획하고 구현하는 방법을 지나치게 고정하지 않고, 검증 가능한 산출물을 중심으로 관리합니다.
- 재사용과 단계적 자원 공개를 장려: 결과물, 역할별 도구, 스킬을 필요한 시점에 제공하며, 이미 만든 것을 다시 만들지 않도록 합니다.
- 버전이 있는 프로젝트 이력 유지: 프로젝트 상태를 기록해 비교, 복구, 후속 개선에 활용합니다.
논문은 GameCraft-Bench, FrontierSWE, ProgramBench에서 세 가지 하네스-모델 조합을 평가했습니다. 조합은 Codex와 GPT-5.5, OpenCode와 DeepSeek-V4-Pro, Pi와 MiniMax-M3입니다. 요약된 결과에 따르면 HoH는 세 번의 반복 후 각 독립 하네스보다 일관되게 높은 성능을 보였으며, 평균 상대 향상은 52.25%, 최대 향상은 82.86%였습니다. 별도의 다일 배포에서는 70회가 넘는 반복을 통해 1인칭 슈팅 게임을 자율적으로 개발했습니다. 해당 결과물에는 일관된 이야기, 구현된 핵심 메커니즘, 사람이 플레이할 수 있는 경험, 개선된 시각 요소와 통합 오디오가 포함됐습니다.
의미와 한계
HoH의 핵심 가치는 한 번의 코드 생성 점수보다 장기 소프트웨어 개발을 피드백과 상태 관리의 문제로 다룬 데 있습니다. 작업 분해, 검증 시점, 자원 접근, 과거 결과의 재사용은 더 큰 모델만큼이나 코딩 에이전트의 성능에 영향을 줄 수 있습니다. 이는 에이전트의 발전이 모델 규모뿐 아니라 이를 둘러싼 하네스 설계에서도 나올 수 있음을 보여줍니다.
다만 제공된 자료는 주로 초록 수준이므로 프로젝트 규모, 평가 방식, 계산 비용이 달라질 때도 같은 결과가 유지되는지는 확인하기 어렵습니다. 70회가 넘는 시연 역시 모든 소프트웨어 프로젝트가 무감독으로 완성된다는 뜻은 아닙니다. 앞으로는 반복적인 실패에서의 복구, 장기 코드 품질, 테스트 범위, 반복 횟수와 비용의 관계를 더 면밀히 검증해야 합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…