Nvidia 연구가 보여준 것: AI 에이전트의 진짜 주역은 모델보다 Harness
들어가며
AI 성능을 비교할 때 업계는 주로 모델의 크기와 벤치마크 점수, 추론 능력에 주목합니다. 그러나 여러 판단을 장기간 이어 가야 하는 AI 에이전트에서는 모델 주변의 소프트웨어 계층이 결과를 크게 바꿀 수 있습니다. Nvidia의 새로운 연구는 에이전트 성능의 주역이 반드시 모델 하나만은 아니라는 점을 보여줍니다.
Harness는 모델을 실제로 작동하는 에이전트로 바꾸는 실행 구조입니다. 기억과 컨텍스트를 관리하고, 도구와 라이브러리를 제공하며, 피드백을 수집하고, 에이전트가 막혔을 때 취할 행동을 정합니다. 모델이 판단의 핵심이라면 Harness는 그 판단을 지속적인 행동으로 연결하는 운영 시스템에 가깝습니다.
핵심 내용
- Nvidia 연구진은 Claude Opus 5를 위해 맞춤형 Harness를 만들었고, 명확한 설명 없이 2차원 게임의 규칙을 찾아야 하는 ARC-AGI-3에서 100%의 점수를 기록했다고 밝혔습니다.
- Harness를 사용하지 않았을 때 Opus 5의 점수는 30%였습니다. 이 수치 역시 시험 모델 가운데 가장 높았지만, 두 결과의 차이는 주변 시스템의 영향력을 잘 보여줍니다.
- 연구진은 감독 에이전트도 추가했습니다. 이 구성 요소는 관리자처럼 주 에이전트를 지켜보며, 막다른 길이나 비효율적인 탐색에 빠졌을 때 방향을 조정합니다.
- 장기 과제에서는 기억, 컨텍스트 처리, 계획 수립, 실패한 경로의 회피가 중요합니다. 문서 편집을 다룬 다른 연구에서도 최신 모델들이 여러 결정을 연속으로 수행하는 과정에서 오류를 누적한 것으로 나타났습니다.
의미와 영향
한 번의 질문에 정확히 답하는 모델이 몇 시간 또는 며칠 동안 업무를 안정적으로 끝낼 수 있다는 뜻은 아닙니다. 에이전트는 무엇을 시도했는지 기억하고, 어떤 접근이 실패했는지 판단하며, 적절한 시점에 도구를 호출하고, 처음의 목표를 유지해야 합니다. 이런 제어 장치가 부족하면 강력한 모델도 작업 중 방향을 잃고 파일이나 데이터베이스를 훼손할 수 있습니다.
Harness는 비용 구조에도 영향을 미칩니다. 소재에서 소개한 Databricks 연구는 같은 모델이라도 Harness의 구성에 따라 비용이 크게 달라질 수 있다고 지적합니다. 기업은 어떤 모델을 선택할지뿐 아니라 어떤 기억 전략, 재시도 정책, 도구 호출 방식, 감독 구조를 사용할지도 함께 결정해야 합니다.
Nvidia가 사용한 Agentic Variation Operators, 즉 AVO는 새로 출시된 제품이 아니라 연구팀이 구축한 Harness입니다. Nvidia는 Nemo 생태계를 통해 에이전트 스택을 구성하는 여러 기술 요소도 제공하고 있습니다. 앞으로의 경쟁은 더 강한 모델을 만드는 경쟁을 넘어, 기억과 감독, 실행 환경, 안전 규칙을 얼마나 잘 설계하느냐의 경쟁으로 확장될 가능성이 큽니다.
출처: TechCrunch AI
댓글
로그인 상태 확인 중…
댓글 불러오는 중…