아티클 목록으로
코딩 AI

Claude·Codex·Cursor는 도구를 어떻게 고를까: 1만7000회 실험

약 3분 소요

들어가며

코딩 에이전트에게 결제, 이메일, 스토리지 또는 배포 기능을 추가하라고 하면 Claude Code, Codex, Cursor는 같은 서비스를 추천할까? Armature는 이 질문을 검증하기 위해 세 에이전트를 대상으로 총 16,893회의 실험을 수행하고, 정보를 찾는 방식과 실제 구현 결과를 비교했다.

실험 구성

연구팀은 공개 GitHub 저장소를 분석해 프로그래밍 언어, 프레임워크, 외부 서비스, 배포 플랫폼, 팀 규모와 코드베이스의 연식에 맞춘 실험 패널을 구성했다. 이후 10개 언어를 사용하는 75개의 가상 저장소를 제작했다. 회사명, Git 기록, 인증 정보는 가짜였지만 잠금 파일은 실제 패키지 레지스트리와 대조했다.

과제는 증상과 원하는 상태만 말하는 바이브 코더부터, 규정 준수·조달·운영 제약을 구체적으로 제시하는 대기업 엔지니어까지 여러 사용자 유형에 맞춰 작성했다. 모든 실행은 임시 샌드박스에서 이뤄졌고, 에이전트가 먼저 해결책을 분석·추천한 뒤 모의 사용자가 1순위 안을 채택하거나 구현을 요청하는 대화 과정도 넣었다. 이는 허가를 요청할 수 없을 때 에이전트가 무조건 직접 만드는 편향을 줄이기 위한 장치였다.

16,893회 중 첫 분석에는 51개 저장소와 18개 분야에서 나온 5,292개 유효 세션이 사용됐다. 나머지 기록은 향후 추가 분석 대상이다.

핵심 결과

  • 웹 검색 방식이 다르다. Cursor는 약 3분의 2의 세션에서 웹을 참고했고, Codex는 94%에서 검색했다. Codex는 site: 같은 연산자로 신뢰할 만한 도메인에 검색 범위를 좁히는 경우가 많았다. Claude Code의 검색 비율은 약 30%였지만, 검색할 때는 Codex보다 약 3배 많은 페이지를 살폈다. 샌드박스처럼 새로운 분야에서는 검색 비율이 약 80%까지 높아졌다.
  • 최종 선택은 자주 엇갈린다. 세 에이전트가 같은 도구를 고른 비율은 42%에 그쳤다. 음성 에이전트 과제에서는 Claude Code가 Twilio, Codex가 OpenAI Realtime API, Cursor가 Vapi를 선호했다. Claude Code의 자체 구현 비율은 약 19%로, Codex와 Cursor의 약 10%보다 거의 두 배였다.
  • 저장소 맥락이 승자를 바꾼다. 같은 이메일 요구사항에서도 TypeScript에서는 Resend, Python에서는 SendGrid, Go에서는 Postmark, Java에서는 Azure Communication Services가 강세였다. Vercel은 TypeScript, 특히 Next.js 프로젝트에서 우세했지만 Python 프로젝트에서는 추천되지 않았고 Render가 더 자주 선택됐다.
  • 언급량은 채택을 보장하지 않는다. PayPal은 139번 언급됐지만 한 번도 선택되지 않았고, Adyen은 175번 언급 중 세 번만 채택됐다. LangChain, Netlify, Supabase도 대화에 자주 등장했지만 최종 승자가 되는 경우는 제한적이었다.
  • 세부 정보가 결과를 뒤집을 수 있다. 무료 요금제의 보존 기간, 관리 부담, 기능 묶음이 선택에 영향을 줬다. 데이터베이스만 필요한 과제에서는 인증·스토리지·실시간 기능까지 포함한 Supabase가 오히려 불리해질 수 있었다.

의미와 영향

이번 결과는 코딩 에이전트가 모든 프로젝트에 적용되는 고정된 서비스 순위를 갖고 있지 않다는 점을 보여준다. 추천은 사전 지식, 검색 결과, 기존 코드 구조, 언어 생태계가 결합된 결과다. 따라서 동일한 요구라도 저장소가 바뀌면 답도 달라질 수 있다.

개발자는 에이전트의 첫 추천을 구매 결정으로 받아들이기보다, 제약 조건과 대안을 명시하게 하고 규정 준수, 비용, 이전 난이도와 장기 운영 위험을 직접 검토해야 한다. 공급업체에는 제품 기능뿐 아니라 검색하기 쉬운 문서와 명확한 요금·기능 설명도 중요해진다.

출처: Hacker News

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
후학습과 탐색으로 IOI 금메달 수준에 도달한 코딩 AI
코딩 AI
cctest.ai
코딩 AI

후학습과 탐색으로 IOI 금메달 수준에 도달한 코딩 AI

한 연구가 문제 선별, 합성 추론 트레이스, 지도 미세조정, 강화학습, 추론 시 반복 개선을 결합한 경쟁 프로그래밍 전문화 파이프라인을 제시했다. 연구진은 IOI 2026 평가에서 시스템이 600점 만점에 535.4점을 기록했다고 보고했다.

더 보기
CCTest · Blog
Harness-of-Harness: 코딩 에이전트를 지속적 소프트웨어 개발로 이끄는 방법
코딩 AI
cctest.ai
코딩 AI

Harness-of-Harness: 코딩 에이전트를 지속적 소프트웨어 개발로 이끄는 방법

Harness-of-Harness(HoH)는 새로운 코드 생성 모델이 아니라 기존 코딩 에이전트 하네스를 장기 개발에 맞게 구성하는 프레임워크입니다. 계획, 코딩, 테스트, 독립 평가를 반복해 소프트웨어를 점진적으로 개선합니다.

더 보기