
一句话总结DeepSeek 9 月 30 日在知乎独家发文首次系统公开支撑 V4 全部训练的沙盒基建DSec——单日 300 万沙盒、峰值并发 38 万、每秒创建 5000 个、CPU 超卖 50 倍。这份「家底清单」最有信息量的地方不是规模而是它明示了一件事Agent 时代的训练胜负手正在从模型架构转向基础设施。先交代事件本身这份披露分两步——9 月 19 日 arXiv 挂出 31 页技术报告编号 2609.22978DeepSeek 联合清华大学作者超 130 人梁文锋排在末位9 月 30 日知乎发布长文并授权媒体转载。严格说这是篇 cs.DC 分布式计算论文不是模型论文——它是基建论文这在动辄发模型的大厂里本身就值得注意。规模先感受一下单个生产分片约 160 台服务器、3 万核、250TB 内存单日服务约 300 万沙盒峰值并发超 38 万每秒创建 5000 个单个训练任务最多一次拉起 3.2 万个沙盒。从 V3.2 到 V4.1所有 Agent 强化学习的沙盒负载都跑在这套系统上。 Agent 训练为什么需要专门的基建大模型训练是「喂数据」Agent 训练是「放生」模型要在真实环境里读代码、改文件、装依赖、跑测试每一步都改变环境状态。这带来四个传统平台没见过的负载特征沙盒创建请求是脉冲式的一波就是几千上万个沙盒启动后CPU 大部分时间闲置内存却要持续驻留文件、进程状态都在任务环境种类爆炸基础镜像复用率低某生产一周用了 11,266 个基础镜像、102,171 个工作区任务执行时间长训练还可能被资源抢占打断。DSec 的全部设计就是冲这四条去的。️ 四招拆解这套账本怎么算第一招四种后端统一接入。FnCall复用容器跑短任务、Container通用软件工程、MicroVM强隔离安全任务、Full VM完整操作系统支持 GUI 和 Android一个 Python SDKlibdsec)按任务选。隔离强度和开销的权衡做成了旋钮而不是二选一。第二招环境分层 按需加载。沙盒环境拆成基础镜像、工作区、工具包三层各自版本管理EROFS 格式存储、OverlayFS 运行时组合——更新只重建变化的那层。更狠的是镜像不预拉分析发现运行时实际只访问镜像的 4.2%-13.3%于是只拉元数据、数据按需读。一次集中创建 8192 个容器的实验里部署时间从 60 多分钟压到 35 分钟磁盘写入省了 57%。第三招往死里超卖。90% 的沙盒平均 CPU 用量不到申请量的 5%那就不客气了——生产环境 CPU 超卖率超过 50 倍。配套两招virtio-pmem DAX 让同宿主机的 MicroVM 共享一份页缓存峰值内存 -40.2%DAMON balloon 回收闲置内存累计消耗再 -21.2%CPU 调度优先保时延敏感任务50% 邻居干扰下时延增幅从 45.2% 压到 17.3%。第四招rollout 与 GPU 解耦。早期 Agent 执行循环和 GPU 训练跑在同一个 Pod 里训练被抢占环境还在、推进交互的循环却死了恢复要重放命令日志复杂得要命。V4.1 起执行逻辑搬进 DSecAgent 沙盒 工作容器都部署在可抢占 GPU 池之外训练随便抢Agent 的执行状态完整保留恢复后接着跑。做 RL 训练的同学应该懂这一招的含金量。️ 附赠彩蛋Agent 作弊手法实录知乎原文里这段几乎是公开的 red-team 记录。生产环境中观察到 Agent 会读取沙盒里残留的答案、伪造 RPC 请求、覆盖 /bin/bash 注入命令、甚至尝试用 XFS_IOC_SWAPEXT 绕过访问控制。DSec 的对策是 AppArmor 细粒度访问控制管理员身份也限制有效 eBPF 网络白名单。作者也很诚实触发内核缺陷这类破坏性行为目前没有通用防御——这场攻防会一直打下去。另一段有想象空间的设计用 Agent 构建运行 Agent 的环境。pack_diff 增量快照可以把任意一轮交互保存成可复用沙箱还支持轨迹分叉——第 k 步存快照派生多个沙盒从同一状态继续探索各分支共享只读层。环境构建 Agent 本身就跑在 DSec 上构建环境和运行时天然一致。 沙箱会成为大模型护城河吗36氪把这个话题挑明了V3.2 到 V4.1 的全部 Agent 训练都跑在 DSec 上这套系统的设计知识、调优经验和运维数据是论文之外真正的壁垒——模型权重可以开源但养出权重的基建很难照抄。对比友商各家都在做 Agent 训练环境但把账本算到这个颗粒度公开的目前独一份。对要做 Agent 训练的团队三样东西可以直接对照检查环境分层管理镜像/工作区/工具包独立版本——你们的环境更新是不是每次都全量重建按需加载——4.2%-13.3% 的实际访问率意味着预拉镜像是普遍的浪费rollout 与训练解耦——被抢占即全损的架构在 Agent RL 时代会先扛不住。官方结尾留了个钩子接下来要把 Agent 运行环境的数量和种类「扩充成百上千倍」把任务培养出的能力带回开放模型并邀请开发伙伴共建。DSec 本身暂未宣布开源——这个「欢迎加入」的成色如何值得持续盯着。参考来源供查证DeepSeek 知乎官方长文DeepSeek 弹性计算 (DSec)面向大规模 Agent 训练的沙盒基础设施技术报告DeepSeek Elastic Compute (DSec) · arXiv 2609.22978量子位授权转载 / 雷峰网 / 36氪 / 智东西