DeepSeek DSec:为大规模智能体训练打造弹性沙箱基础设施
导语
当大语言模型从“生成答案”转向自主操作代码仓库、调用工具、执行命令并持续完成任务时,训练系统面对的就不再只是 GPU 计算问题。每个智能体都可能需要一个独立、带状态且具备特定软件依赖的执行环境;在大规模强化学习训练中,这些环境还会成批出现、长时间保留状态,并产生明显的镜像分发和资源调度压力。DeepSeek 在论文中介绍了生产级沙箱平台 DeepSeek Elastic Compute(DSec),试图从基础设施层面解决这一问题。
核心要点
- 统一多种隔离后端。 DSec 通过统一 SDK 提供函数调用、容器、microVM 和完整 VM 沙箱,平台可以根据任务的功能需求与隔离要求选择不同执行形态,而不必让上层训练系统分别适配多套运行时。
- 把沙箱视为可编排资源。 系统负责集群级的放置、创建、生命周期管理和回收,并用独立版本的层组合运行环境。这样既有助于复用环境组件,也能减少每次启动都重新准备完整镜像的成本。
- 面向高密度执行优化资源。 DSec 将内存共享、内存回收和 CPU 调度结合起来,在资源超额分配的情况下维持对延迟敏感任务的服务能力;镜像数据则按需从 Fire-Flyer File System(3FS)加载。
- 与强化学习训练协同设计。 有状态的 rollout 执行与可抢占的 GPU 训练被拆开管理。训练资源需要回收时,系统尽量保留 rollout 状态,并协调沙箱生命周期,避免训练过程因环境丢失而产生额外成本。
- 关注智能体异常行为。 论文还提到,平台会配合训练流程缓解包括 reward hacking 在内的智能体失当行为。这说明沙箱不仅是运行代码的隔离层,也承担着训练可靠性的一部分。
规模与意义
论文披露的生产部署数据包括:单个 DSec 生产单元约覆盖 160 个节点,每天服务约 300 万个沙箱;生产环境中并发沙箱超过 38 万个,创建速率可持续达到每秒 5000 个。作者的评估与部署经验显示,分层环境、按需加载和资源管理机制能够降低环境启动及镜像分发开销,并改善内存利用率。
DSec 的价值不在于提出一种全新的虚拟化技术,而在于将多种执行后端、分布式存储、资源超额分配以及 RL 训练控制整合成一个面向智能体工作负载的系统。随着智能体任务变得更长、更复杂,执行环境本身可能成为训练吞吐和成本的瓶颈。此类平台化设计意味着,未来的智能体基础设施需要同时处理隔离、安全、状态持久化、弹性调度与训练反馈,而不能只把沙箱当作一个简单的容器启动接口。
需要注意的是,当前素材主要来自论文摘要和页面信息,未提供完整实验表格、代码或独立复现实验。因此,DSec 的具体性能优势仍应结合论文全文和后续公开资料进一步判断。
来源:Hacker News
评论
正在确认登录状态……
正在加载评论……