아티클 목록으로
코딩 AI

Harness-of-Harness: 코딩 에이전트를 지속적 소프트웨어 개발로 이끄는 방법

약 3분 소요

들어가며

대규모 언어 모델에게 코드를 작성하게 해 실행 가능한 결과를 얻는 일은 더 이상 유일한 난제가 아닙니다. 더 어려운 문제는 사람의 개입 없이 며칠 동안 개발을 이어가면서 버그를 고치고, 기능을 추가하고, 프로젝트의 맥락을 유지해 실제로 사용할 수 있는 소프트웨어를 완성하는 것입니다. 논문이 제안한 Harness-of-Harness(HoH)는 이러한 장기 자율 개발을 위한 프레임워크입니다. 새로운 기반 모델을 만드는 대신, 기존 코딩 에이전트 하네스의 실행 방식을 조직하고 관리합니다.

핵심 설계

HoH는 계획, 코딩, 테스트를 반복하는 루프를 구성하고, 반복 사이에 독립 평가를 배치합니다. 주요 아이디어는 다음과 같습니다.

  • 수정과 기능 확장을 함께 추진: 기존 결함을 고치는 동시에 제품의 새로운 능력도 추가해, 매번 문제 해결에만 머무르지 않도록 합니다.
  • 작고 검증 가능한 단위로 개발: 범위가 분명한 결과물을 단계적으로 만들고, 장기 작업에서 목표가 흐려지는 위험을 줄입니다.
  • 구현 테스트와 독립 평가를 분리: 개발 중 테스트는 작업 피드백에 사용하고, 독립 평가는 결과물이 요구사항을 실제로 충족하는지 확인합니다.
  • 작업 방식보다 결과를 제약: 에이전트가 계획하고 구현하는 방법을 지나치게 고정하지 않고, 검증 가능한 산출물을 중심으로 관리합니다.
  • 재사용과 단계적 자원 공개를 장려: 결과물, 역할별 도구, 스킬을 필요한 시점에 제공하며, 이미 만든 것을 다시 만들지 않도록 합니다.
  • 버전이 있는 프로젝트 이력 유지: 프로젝트 상태를 기록해 비교, 복구, 후속 개선에 활용합니다.

논문은 GameCraft-Bench, FrontierSWE, ProgramBench에서 세 가지 하네스-모델 조합을 평가했습니다. 조합은 Codex와 GPT-5.5, OpenCode와 DeepSeek-V4-Pro, Pi와 MiniMax-M3입니다. 요약된 결과에 따르면 HoH는 세 번의 반복 후 각 독립 하네스보다 일관되게 높은 성능을 보였으며, 평균 상대 향상은 52.25%, 최대 향상은 82.86%였습니다. 별도의 다일 배포에서는 70회가 넘는 반복을 통해 1인칭 슈팅 게임을 자율적으로 개발했습니다. 해당 결과물에는 일관된 이야기, 구현된 핵심 메커니즘, 사람이 플레이할 수 있는 경험, 개선된 시각 요소와 통합 오디오가 포함됐습니다.

의미와 한계

HoH의 핵심 가치는 한 번의 코드 생성 점수보다 장기 소프트웨어 개발을 피드백과 상태 관리의 문제로 다룬 데 있습니다. 작업 분해, 검증 시점, 자원 접근, 과거 결과의 재사용은 더 큰 모델만큼이나 코딩 에이전트의 성능에 영향을 줄 수 있습니다. 이는 에이전트의 발전이 모델 규모뿐 아니라 이를 둘러싼 하네스 설계에서도 나올 수 있음을 보여줍니다.

다만 제공된 자료는 주로 초록 수준이므로 프로젝트 규모, 평가 방식, 계산 비용이 달라질 때도 같은 결과가 유지되는지는 확인하기 어렵습니다. 70회가 넘는 시연 역시 모든 소프트웨어 프로젝트가 무감독으로 완성된다는 뜻은 아닙니다. 앞으로는 반복적인 실패에서의 복구, 장기 코드 품질, 테스트 범위, 반복 횟수와 비용의 관계를 더 면밀히 검증해야 합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
LinkedIn이 멀티 에이전트로 AI 코드 리뷰를 확장한 방법
코딩 AI
cctest.ai
코딩 AI

LinkedIn이 멀티 에이전트로 AI 코드 리뷰를 확장한 방법

LinkedIn은 기존 AI 리뷰 도구를 저장소 앞에 그대로 붙이는 대신, 여러 리뷰 에이전트와 조직 고유의 규칙을 결합한 플랫폼을 구축했다. 핵심은 댓글 수가 아니라 환각과 저가치 피드백을 줄이고 개발자가 실제로 채택할 만한 신호를 제공하는 데 있다.

더 보기
CCTest · Blog
Uncle Bob의 AI 코딩 실험: 줄단위 리뷰는 줄여도 아키텍처는 사람이 맡아야
코딩 AI
cctest.ai
코딩 AI

Uncle Bob의 AI 코딩 실험: 줄단위 리뷰는 줄여도 아키텍처는 사람이 맡아야

Uncle Bob은 구현을 AI 에이전트에 맡기고, 사람은 자동화된 품질 통제와 아키텍처 판단에 집중하는 개발 방식을 실험하고 있다. 반복적인 코드 검토 부담은 줄일 수 있지만 시스템 구조와 업무 맥락에 대한 판단까지 대체하지는 못한다.

더 보기