DeepSeek DSec, 대규모 에이전트 훈련을 위한 탄력적 샌드박스 인프라
들어가며
대규모 언어 모델이 답변 생성에서 벗어나 저장소를 살펴보고, 도구를 호출하고, 명령을 실행하며, 긴 작업을 자율적으로 수행하기 시작하면 훈련 인프라의 병목도 달라집니다. 각 에이전트 롤아웃에는 독립성과 상태 보존을 갖춘 실행 환경이 필요합니다. 강화학습 훈련에서는 이런 샌드박스가 짧은 시간에 대량으로 생성되고, 서로 다른 소프트웨어 의존성을 사용하며, 오랫동안 상태를 유지할 수 있습니다. 그 결과 환경 초기화, 이미지 배포, 메모리와 CPU 관리가 중요한 시스템 문제가 됩니다. DeepSeek는 논문에서 이 문제를 겨냥한 프로덕션 플랫폼 DeepSeek Elastic Compute, 즉 DSec를 소개했습니다.
DSec의 핵심 설계
- 여러 격리 방식을 하나의 인터페이스로 통합. DSec는 함수 호출, 컨테이너, microVM, 전체 VM 샌드박스를 통합 SDK로 제공합니다. 작업의 기능과 격리 수준에 따라 실행 방식을 선택할 수 있어, 상위 훈련 시스템이 여러 런타임을 각각 연결해야 하는 부담을 줄입니다.
- 클러스터 차원의 수명주기 관리. 배치, 생성, 회수 과정을 클러스터 전체에서 조정합니다. 실행 환경은 독립적으로 버전 관리되는 레이어를 조합해 구성하므로, 매번 거대한 단일 이미지를 준비하는 방식보다 환경 구성 요소를 재사용하기 쉽습니다.
- 고밀도 실행을 위한 자원 최적화. 메모리 공유, 메모리 회수, CPU 스케줄링을 결합해 오버커밋 상황에서도 지연에 민감한 작업을 지원합니다. 이미지 데이터는 Fire-Flyer File System, 즉 3FS에서 필요할 때 가져옵니다.
- 강화학습과 공동 설계. 상태를 가진 롤아웃 실행과 선점 가능한 GPU 훈련을 분리합니다. GPU 자원을 회수해야 할 때도 샌드박스 상태가 불필요하게 사라지지 않도록 훈련 과정과 환경 수명주기를 함께 조정합니다.
- 에이전트의 잘못된 행동도 고려. 논문은 reward hacking을 포함한 에이전트 오작동을 완화하는 방안도 언급합니다. 이는 샌드박스를 단순한 코드 실행 격리층이 아니라 훈련 안정성과 신뢰성을 보조하는 제어 계층으로 본다는 의미입니다.
공개된 규모와 의미
논문에 따르면 하나의 프로덕션 단위는 약 160개 노드로 구성되며 하루 약 300만 개의 샌드박스를 처리합니다. 프로덕션 환경에서는 38만 개가 넘는 샌드박스를 동시에 제공하고, 초당 5000건 이상의 생성 속도를 유지한다고 설명합니다. 저자들은 계층형 환경, 온디맨드 이미지 로딩, 자원 관리 조합이 환경 초기화와 이미지 배포 오버헤드를 낮추고 메모리 효율을 개선했다고 보고합니다.
DSec의 핵심은 새로운 가상화 기술 하나를 제시했다는 데 있지 않습니다. 여러 격리 백엔드, 분산 파일 시스템, 자원 오버커밋, 상태 관리, 강화학습 오케스트레이션을 에이전트 워크로드에 맞춰 하나의 플랫폼으로 묶었다는 점이 중요합니다. 에이전트 작업이 길고 복잡해질수록 샌드박스 운영은 훈련 처리량과 비용을 좌우할 수 있습니다. 따라서 앞으로의 에이전트 인프라는 격리뿐 아니라 상태 보존, 탄력적 스케줄링, 저장장치 접근, 훈련 피드백까지 함께 다뤄야 합니다.
다만 현재 자료는 논문 초록과 서지 정보 중심이며, 전체 실험표와 코드, 독립적인 재현 결과는 포함하지 않습니다. 구체적인 성능 우위는 논문 전문과 후속 공개 자료를 통해 추가로 확인할 필요가 있습니다.
출처: Hacker News
댓글
로그인 상태 확인 중…
댓글 불러오는 중…