아티클 목록으로
월드 모델

Trace2Env, 언어 모델로 상태를 유지하는 상호작용 환경 구축

약 3분 소요

들어가며

에이전트를 훈련하고 평가하려면 여러 단계의 행동에 현실적으로 반응하는 환경이 필요하다. 하지만 실제 시스템은 비공개 서비스이거나, 오래된 소프트웨어이거나, 배포가 어렵거나, 더 이상 접근할 수 없을 수 있다. 원래 환경을 실행 가능한 프로그램으로 다시 만드는 방식은 비용이 크고, 숨은 제약과 예외적인 동작을 놓치기 쉽다.

논문 「From Traces to Agentic Worlds」는 다른 접근을 제시한다. 환경을 프로그램으로 복원하는 대신 언어 모델 에이전트가 환경 역할을 맡도록 하는 것이다. 연구진은 이를 agentic language world modeling이라 부르고, 학습이 필요 없는 Trace2Env 프레임워크로 구현했다.

Trace2Env의 작동 방식

  • 소스 코드 대신 상호작용 기록을 사용한다: 원래 시스템에 접근할 수 없어도 과거의 행동-관찰 궤적이 있으면 환경의 동역학을 근사할 수 있다.
  • worldbook을 만든다: 오프라인 재구성 단계에서 환경 스키마, 행동 규칙, 제약, 불변조건, 시연 사례와 근거가 있는 증거를 정리한다. 단순한 긴 프롬프트가 아니라 실행 중 조회할 수 있는 지식 기반이다.
  • 상태를 지속적으로 관리한다: 월드 모델 에이전트는 각 행동마다 worldbook, 현재 에피소드 상태, 에피소드 기억을 함께 참고해 즉시 관찰과 다음 턴까지 남아야 할 상태 변화를 추론한다.
  • 추론과 상태 반영을 분리한다: 공유 런타임이 에이전트의 제안을 검증하고 승인된 변화만 반영한다. 따라서 이전 행동의 결과가 이후 관찰에 이어질 수 있다.

결과와 한계

평가에는 터미널, 소프트웨어 저장소, Android 및 웹 애플리케이션, 기업 서비스, 텍스트 게임 등 9개 환경 유형이 포함됐다. 일반적인 프롬프트 기반 언어 월드 모델과 비교했을 때 Trace2Env는 다음 관찰의 충실도와 긴 상호작용에서의 일관성을 높였다. 또한 시뮬레이션 환경을 기준으로 생성한 작업 에이전트의 행동은 실제 환경에서 재생했을 때 더 자주 유효하게 유지됐다. 이는 그럴듯한 응답을 생성하는 데 그치지 않고, 이전 행동이 만든 결과를 후속 상호작용에도 더 잘 보존한다는 의미다.

다만 성능은 수집된 기록의 범위와 품질에 좌우된다. 기록에 없는 상태, 예외 경로, 드문 조작에 대해서는 신뢰할 만한 근거가 부족할 수 있다. 따라서 Trace2Env는 원래 시스템의 완전한 대체재라기보다 검증하고 개선할 수 있는 환경 근사치로 보는 편이 적절하다.

의미와 영향

이 방식은 에이전트 환경을 만드는 비용을 낮춘다. 실제 서비스에 접근하지 못하는 상황에서의 훈련, 안전하고 재현 가능한 샌드박스 평가, 도구·API·MCP 백엔드·기업 업무를 위한 상태 기반 목업 등에 활용할 수 있다. 비공개이거나 오래됐거나 사용할 수 없는 시스템의 로그도 단순한 평가 기록을 넘어 상호작용 가능한 세계를 만드는 재료가 될 수 있다.

에이전트가 장기 계획을 더 많이 수행할수록 환경이 과거를 기억하고, 제약을 지키며, 상태를 일관되게 전달하는 능력이 중요해진다. Trace2Env는 월드 모델을 ‘다음 텍스트를 예측하는 모델’에서 ‘행동에 지속적으로 반응하는 환경’으로 확장하려는 시도로 볼 수 있다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
DreamTrue, 로봇 월드 모델의 행동 충실도를 높이다
월드 모델
cctest.ai
월드 모델

DreamTrue, 로봇 월드 모델의 행동 충실도를 높이다

DreamTrue는 입력된 행동을 더 정확히 반영하고 물리적으로도 타당한 미래 영상을 생성하도록 설계된 다중 시점·이기종 로봇 대응 월드 모델입니다. 이미지 공간 보정, 반사실적 후속 학습, 인간 평가 기반 보상 모델을 결합합니다.

더 보기
CCTest · Blog
WorldGuide, 동영상 세계 모델을 목표 지향 작업 실행기로 확장
월드 모델
cctest.ai
월드 모델

WorldGuide, 동영상 세계 모델을 목표 지향 작업 실행기로 확장

WorldGuide는 절차적 동영상 생성을 폐루프 작업 실행 문제로 다룬다. 현재 시각 상태에서 다음 원자 행동을 계획하고, 해당 행동을 동영상으로 생성한 뒤 결과를 바탕으로 다음 행동이나 종료 여부를 결정한다.

더 보기
CCTest · Blog
WorldSonus, 월드 모델에 실시간 공간 음향을 더하다
월드 모델
cctest.ai
월드 모델

WorldSonus, 월드 모델에 실시간 공간 음향을 더하다

WorldSonus는 월드 모델을 위해 영상에서 제어 가능한 스테레오 음향을 실시간으로 생성하는 인터랙티브 비디오-오디오 프레임워크입니다. 논문은 0.41의 실시간 계수와 오픈 도메인 벤치마크에서의 높은 일반화 성능을 보고합니다.

더 보기