AgentGarten, 진화하는 에이전트를 위한 코드 기반 세계를 만들다
들어가며
에이전트가 무엇을 배울 수 있는지는 어떤 세계에서 훈련되는지에 달려 있다. 기존 환경은 대체로 한 가지를 선택해야 했다. 규칙과 상태 전이가 안정적인 시뮬레이터는 화면이 단순할 수 있고, 시각적으로 사실적인 생성 환경은 객체의 지속성이나 장기적인 상태 일관성을 보장하기 어렵다. AgentGarten은 이 두 요구를 하나의 확장 가능한 구조로 묶으려는 시도다.
핵심 구성
- 시뮬레이션 백엔드가 세계를 운영한다: 시뮬레이터나 게임 엔진이 지속적인 세계 상태를 유지하고 프로그램으로 정의된 상호작용 규칙을 실행한다. 에이전트의 행동은 단순히 이미지 한 장을 바꾸는 것이 아니라 추적 가능한 상태 변화를 일으킨다.
- 공유 렌더러가 관측을 생성한다: 각 백엔드는 공통 인터페이스를 통해 구조화된 조건을 내보내고, 신경 렌더러는 이를 에이전트가 보는 시각 프레임으로 변환한다. 세계의 논리와 외관을 분리함으로써 새로운 환경을 추가하기 쉬워진다.
- Adversarial Forcing으로 시간적 품질을 높인다: 사전학습된 비디오 모델을 기하 조건에 맞게 조정하고, 정확한 재생을 통해 과거 기록을 채우는 과정이 미분 가능하도록 만든다. 그 결과 이후 프레임의 손실이 이전 관측의 인코딩에 전달된다. 실제 데이터에 기반한 적대적 감독도 시각적 품질 개선에 사용된다.
- 경험을 플레이북으로 축적한다: 한 라운드가 끝나면 에이전트는 경험을 검토하고 유용한 절차를 플레이북으로 정리한다. 다음 에이전트는 이를 물려받아 실제 상호작용 속에서 시험하고 수정할 수 있다.
결과와 의미
제시된 숨바꼭질 실험에서 숨어야 하는 에이전트는 4라운드까지 은신처를 만들었고, 찾는 에이전트는 10라운드까지 경사로를 사용하기 시작했다. 이는 지속적인 상태와 라운드 간 경험 전달이 매번 처음부터 탐색하는 방식보다 더 구조화된 전략의 형성을 도울 수 있음을 보여준다. 소재는 적은 라운드에서도 학습 효율이 크게 향상됐다고 설명하지만, 전체 정량 결과는 제공하지 않으므로 모든 과제에 동일하게 적용된다고 해석해서는 안 된다.
AgentGarten의 더 큰 의미는 환경 제작과 에이전트 학습을 코드 수준에서 연결한다는 점이다. 개발자는 새로운 규칙과 공간을 코드로 작성한 뒤 동일한 인터페이스와 렌더링 파이프라인에 연결할 수 있다. 이는 장기 계획, 도구 사용, 다중 에이전트 상호작용을 연구할 때 환경을 옮기는 비용을 낮출 가능성이 있다.
물론 사실적인 화면이 곧 현실적인 인과관계나 물리 법칙을 의미하지는 않는다. 렌더링 지연, 장시간 시각 일관성, 규칙의 범위, 자동으로 작성된 플레이북의 신뢰성은 추가 검증이 필요하다. 따라서 AgentGarten은 완성된 세계 모델이라기보다, 프로그래밍 가능한 상태 관리와 풍부한 시각 인터페이스를 결합하는 인프라 제안으로 보는 편이 타당하다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…