아티클 목록으로
코딩 AI

LinkedIn이 멀티 에이전트로 AI 코드 리뷰를 확장한 방법

약 4분 소요

들어가며

대규모 조직에서 AI 코드 리뷰의 어려움은 많은 댓글을 만들어내는 데 있지 않다. 개발자가 그 댓글을 사실에 근거한 유용한 지적으로 받아들이고, 실제 코드 변경으로 이어지게 만드는 일이 더 어렵다. 소재에 따르면 기존 AI 리뷰 도구를 그대로 사용하는 방식에는 세 가지 구조적 한계가 있다. 단일 모델의 맹점 때문에 특정 오류를 놓치거나 비슷한 저가치 문제를 반복해서 지적할 수 있다. 조직 정책과 저장소별 관례를 충분히 반영하기 어렵고, 지연 시간이나 품질, 장애를 엔지니어링 시스템처럼 관리하기도 힘들다.

LinkedIn은 이 문제를 해결하기 위해 AI 리뷰를 단순한 개발 도구가 아니라 운영 가능한 프로덕션 인프라로 다뤘다. 여러 에이전트가 참여하는 플랫폼의 목표는 댓글을 최대화하는 것이 아니라 신호 대 잡음비를 높이고, 사람의 리뷰가 끝나기 전에 가치 있는 문제를 전달하는 것이다.

플랫폼의 핵심 설계

  • 독립적인 리뷰 에이전트. 여러 에이전트가 서로 다른 모델이나 추론 방식을 사용해 같은 변경 사항을 검토한다. 여러 에이전트가 독립적으로 같은 문제를 발견하면 이를 신뢰도를 높이는 근거로 본다. 한 에이전트만 발견한 문제도 자동으로 버리지 않고 별도의 검증 절차를 거친다.
  • 조직의 지식을 리뷰에 반영. 조직 수준의 정책, 저장소 수준의 코딩 관례, 특정 맥락이나 고위험 영역에 적용되는 규칙을 조합할 수 있다. 따라서 일반적인 베스트 프랙티스뿐 아니라 팀이 장기간 축적한 암묵적 지식도 검토 과정에 포함된다.
  • 게시 전 결과 필터링. 겉치레에 가까운 제안, 이미 수정된 문제, 변경과 무관한 피드백, 저장소 관례와 맞지 않는 권고를 개발자에게 전달하기 전에 제거한다. 모델이 생성한 내용을 모두 노출하지 않는 것이 워크플로의 신뢰도를 지키는 방법이다.
  • 인프라 수준의 운영. Kubernetes 기반 이벤트 구동 파이프라인에 영속 큐와 수평 확장 가능한 작업 노드를 결합한다. 이를 통해 지연 시간, 제안 수용률, 작업 완료율, 공급업체 장애를 모니터링할 수 있다. AI 리뷰어를 블랙박스가 아니라 측정하고 개선할 수 있는 서비스로 만드는 접근이다.

생성량보다 실제 채택률

LinkedIn은 AI 제안과 최종 병합 코드를 비교하는 자동 평가 파이프라인도 만들었다. 1727개 PR에서 추출한 5230개 리뷰 댓글 가운데 90.1%는 병합 결과를 바탕으로 높은 신뢰도로 평가할 수 있었으며, 전체 제안 채택률은 63.9%였다. 유형별로는 논리 오류가 80%, 버그 수정이 58.1%, 리팩터링 변경이 43.5%, 보안 관련 수정이 40.6%, 동시성 결함이 100%로 나타났다.

이 수치가 모든 댓글의 품질이 동일하다는 뜻은 아니다. 다만 AI 리뷰를 평가할 때 생성된 댓글 수보다 최종 코드에 실제로 반영된 변화가 더 중요한 지표가 될 수 있음을 보여준다. 개발자 행동과 병합 결과를 연결해야 도구의 실질적인 가치를 파악할 수 있다.

의미와 영향

LinkedIn의 사례는 기업용 AI 코딩 도구의 경쟁이 더 강한 모델 하나를 연결하는 단계에서 검증, 맞춤화, 운영을 포함하는 시스템 설계 단계로 이동하고 있음을 보여준다. 멀티 에이전트가 환각을 자동으로 없애는 것은 아니며, 오케스트레이션과 검증에 따른 비용도 추가된다. 그러나 서로 다른 검토 능력을 분리하고 독립적인 판단을 비교할 수 있다는 점은 단일 모델 의존성을 낮추는 장점이 된다.

Cloudflare는 OpenCode를 중심으로 한 오케스트레이션 시스템을, Databricks는 Unity AI Gateway와 Omnigent 같은 구성요소를 통해 다른 균형점을 모색하고 있다. 다른 조직이 배워야 할 핵심은 특정 아키텍처를 그대로 복제하는 것이 아니다. 먼저 가치 있는 리뷰의 기준을 정하고, 채택률·오탐·지연·장애 복구를 지속적으로 측정하는 피드백 루프를 만드는 일이다.

AI가 생성하는 코드가 늘어날수록 도구의 성패는 얼마나 많은 댓글을 쓰느냐보다, 그 댓글을 개발자의 신뢰와 더 나은 병합 코드로 얼마나 꾸준히 전환하느냐에 달릴 가능성이 크다.

출처: InfoQ 중국어

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Uncle Bob의 AI 코딩 실험: 줄단위 리뷰는 줄여도 아키텍처는 사람이 맡아야
코딩 AI
cctest.ai
코딩 AI

Uncle Bob의 AI 코딩 실험: 줄단위 리뷰는 줄여도 아키텍처는 사람이 맡아야

Uncle Bob은 구현을 AI 에이전트에 맡기고, 사람은 자동화된 품질 통제와 아키텍처 판단에 집중하는 개발 방식을 실험하고 있다. 반복적인 코드 검토 부담은 줄일 수 있지만 시스템 구조와 업무 맥락에 대한 판단까지 대체하지는 못한다.

더 보기