아티클 목록으로
AI 에이전트

Nvidia 연구가 보여준 것: AI 에이전트의 진짜 주역은 모델보다 Harness

약 3분 소요

들어가며

AI 성능을 비교할 때 업계는 주로 모델의 크기와 벤치마크 점수, 추론 능력에 주목합니다. 그러나 여러 판단을 장기간 이어 가야 하는 AI 에이전트에서는 모델 주변의 소프트웨어 계층이 결과를 크게 바꿀 수 있습니다. Nvidia의 새로운 연구는 에이전트 성능의 주역이 반드시 모델 하나만은 아니라는 점을 보여줍니다.

Harness는 모델을 실제로 작동하는 에이전트로 바꾸는 실행 구조입니다. 기억과 컨텍스트를 관리하고, 도구와 라이브러리를 제공하며, 피드백을 수집하고, 에이전트가 막혔을 때 취할 행동을 정합니다. 모델이 판단의 핵심이라면 Harness는 그 판단을 지속적인 행동으로 연결하는 운영 시스템에 가깝습니다.

핵심 내용

  • Nvidia 연구진은 Claude Opus 5를 위해 맞춤형 Harness를 만들었고, 명확한 설명 없이 2차원 게임의 규칙을 찾아야 하는 ARC-AGI-3에서 100%의 점수를 기록했다고 밝혔습니다.
  • Harness를 사용하지 않았을 때 Opus 5의 점수는 30%였습니다. 이 수치 역시 시험 모델 가운데 가장 높았지만, 두 결과의 차이는 주변 시스템의 영향력을 잘 보여줍니다.
  • 연구진은 감독 에이전트도 추가했습니다. 이 구성 요소는 관리자처럼 주 에이전트를 지켜보며, 막다른 길이나 비효율적인 탐색에 빠졌을 때 방향을 조정합니다.
  • 장기 과제에서는 기억, 컨텍스트 처리, 계획 수립, 실패한 경로의 회피가 중요합니다. 문서 편집을 다룬 다른 연구에서도 최신 모델들이 여러 결정을 연속으로 수행하는 과정에서 오류를 누적한 것으로 나타났습니다.

의미와 영향

한 번의 질문에 정확히 답하는 모델이 몇 시간 또는 며칠 동안 업무를 안정적으로 끝낼 수 있다는 뜻은 아닙니다. 에이전트는 무엇을 시도했는지 기억하고, 어떤 접근이 실패했는지 판단하며, 적절한 시점에 도구를 호출하고, 처음의 목표를 유지해야 합니다. 이런 제어 장치가 부족하면 강력한 모델도 작업 중 방향을 잃고 파일이나 데이터베이스를 훼손할 수 있습니다.

Harness는 비용 구조에도 영향을 미칩니다. 소재에서 소개한 Databricks 연구는 같은 모델이라도 Harness의 구성에 따라 비용이 크게 달라질 수 있다고 지적합니다. 기업은 어떤 모델을 선택할지뿐 아니라 어떤 기억 전략, 재시도 정책, 도구 호출 방식, 감독 구조를 사용할지도 함께 결정해야 합니다.

Nvidia가 사용한 Agentic Variation Operators, 즉 AVO는 새로 출시된 제품이 아니라 연구팀이 구축한 Harness입니다. Nvidia는 Nemo 생태계를 통해 에이전트 스택을 구성하는 여러 기술 요소도 제공하고 있습니다. 앞으로의 경쟁은 더 강한 모델을 만드는 경쟁을 넘어, 기억과 감독, 실행 환경, 안전 규칙을 얼마나 잘 설계하느냐의 경쟁으로 확장될 가능성이 큽니다.

출처: TechCrunch AI

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
PolicyGuide, 단일 행동 차단에서 전체 업무 흐름 안내로
AI 에이전트
cctest.ai
AI 에이전트

PolicyGuide, 단일 행동 차단에서 전체 업무 흐름 안내로

PolicyGuide는 조직 정책을 워크플로 그래프로 변환하고 사용자 발화가 끝날 때마다 에이전트의 상태를 선제적으로 검증한다. 위험한 행동만 막는 대신 누락된 절차를 찾아 정책에 맞는 다음 단계로 안내하는 접근법이다.

더 보기