大模型训练的算力叙事一直由 GPU 卡数、通信拓扑与显存带宽主导,但智能体训练正在把系统工程师拖入另一处泥潭。DeepSeek 披露的大规模智能体强化学习弹性沙盒论文《DeepSeek Elastic Compute (DSec)》(arXiv 页面登记时间为 2026 年 9 月 22 日,提交历史显示于 9 月 19 日上传),完整展现了一套独立于 GPU 训练集群之外的宿主机执行底座。
这篇论文的核心现实判断在于:当强化学习演进到智能体自我探索阶段,系统吞吐的死穴已不再只是前向推理或梯度同步,而是数以万计带着文件修改、代码执行与网络调用的带状态环境。DeepSeek 建立 DSec 的真实目的,是在极低硬件成本下接住这些突发、稀疏且短命的环境风暴,同时防止易遭抢占的 GPU 训练节点因突发中断而白费采样轨迹。
DeepSeek DSec浮出水面:环境执行爆炸取代算力短缺
在智能体强化学习训练中,模型需要频繁在代码解释器、命令行与桌面环境中完成轨迹探索。这一流程极度重度依赖带状态沙盒,传统依靠标准 Kubernetes 启动 Docker 镜像的做法,在面对每秒数千次突发创建时会直接引发磁盘 I/O 阻塞与内存耗尽。DSec 给出的工程解答,是一套统一纳管函数调用、容器、Firecracker 微虚拟机与完整虚拟机的执行集群。

在配置上,DSec 单个生产规模单元由约 160 个节点组成,统管约 30,000 个核心 与 250 TB DRAM。该单元每天承载约 300 万个沙盒创建,生产环境中支撑着超过 380,000 个并发沙盒,峰值创建速率突破每秒 5,000 个。其单节点最高可配置承载约 3,200 个容器或 800 个微虚拟机,生产实际观察到的单节点日峰值也分别达到 1,048 个容器与 524 个微虚拟机。
市场常将 DSec 与终端产品混为一谈。截至 2026 年 9 月 26 日,OpenAI 已将独立运行的 Operator 整合进 ChatGPT agent 模式,Anthropic 则是通过 Claude 计算机使用接口提供客户端工具契约。这些属于面对用户的交互产品与抽象接口,DSec 则是位于机房底层的执行集群,真实对标物是业界用 Kubernetes、Ray 与轻量虚拟机构建的自研训练运行时。
极限超配与存储止血:如何让单机塞下数千沙盒
能够支撑这种密度的前提,在于系统架构师抓住了真实负载的极度不均匀性。DeepSeek 生产监控发现,约 90% 的沙盒任务 平均仅消耗其所申请 CPU 配额的 5% 或更少。如果按传统资源预留逻辑分配物理机,集群容量会在一瞬间见顶。受控超配因而成为整套架构的基石。

超配带来的直接冲击是磁盘 I/O 挤兑。数据采样表明,智能体在单次任务中实际仅读取镜像数据的 4.2% 至 13.3%,其余九成文件根本未被触碰。针对此特点,DSec 抛弃了全量本地解包的做法,改由集群只读文件系统 3FS 配合 EROFS 只读镜像格式按需拉取。在 8,192 个容器的并发下发测试中,该方案把原本超过 60 分钟的拉取耗时缩减至约 35 分钟,提速 1.71 倍,单节点磁盘写入量从超过 1,600 GB 降至约 700 GB,写入削减约 57%。面对可组合镜像层,EROFS 也让下发时间由 79 分钟压缩到 45 分钟,避免了 tar 归档解压带来高达 5.5 倍的写入膨胀与 3.4 倍的峰值吞吐压力。
内存与调度同样被压榨至极限。DSec 通过 virtio-pmem 与 DAX 技术使不同微虚拟机直接共享同一宿主机物理内存页,把宿主机峰值内存占用减少 40.2%;配合内核级空闲页报告与内存气球技术,综合内存开销又进一步压降 21.2%。而在高密度混部下,为了不让抢占型背景任务拖慢实时交互,团队采用 SCHED_IDLE 与核心调度技术,在 50% 干扰负载下将关键任务的延迟膨胀从 45.2% 抑制在 17.3% 的区间。
智能体基建的本质不是堆砌算力卡,而是在系统被冷启动压死前完成极限制流。
- 结论.将长时间运行的状态环境与昂贵且易被中断的 GPU 训练节点剥离,是保证强化学习探索轨迹不因调度抢占而归零的有效解法。
亮眼基准背后的工程留白与安全代价
DSec 展示了一套漂亮的宿主机优化答卷,但审视其系统评估范围,依然存在关键的断层。最显眼的反差在于,整套系统设计的最高诉求是服务强化学习训练吞吐,然而论文公布的所有受控对照实验均在一个独立的 10 节点 CPU 测试集群上完成。

实验没有提供强化学习框架端到端跑通的收敛曲线,也未列出这一套沙盒集群为整体训练节省了多少显存等待时间,甚至没有折算成美元维度的成本账本。对于真正掌管集群预算的架构师来说,它证明了 CPU 和磁盘没有被炸毁,却尚未证明整体训练流水线的真实收益。
| 评估维度 | DSec 论文公开指标 | 业界生产环境关注核心 | 现状评估 |
|---|---|---|---|
| 存储写入控制 | 8,192 容器下写入量压减 57% | 极端突发下的磁盘生命周期与 IOPS 成本 | 已由微基准测试验证 |
| 高密混部防抖 | 50% 干扰下延迟膨胀压至 17.3% | 轨迹收集耗时对 GPU 训练步长的时间拖累 | 局限在 10 节点测试集 |
| 端到端训练回报 | 论文明确声明 RL 端到端集成不纳入评估 | GPU 有效利用率百分比与集群综合开支 | 尚未给出量化数据 |
| 多租户安全防护 | 记录到 Agent 探测 socket 与覆写 shell | CVE 渗透测试与容器/微虚拟机防逃逸 | 缺乏形式化攻击者模型 |
更现实的制约在于安全防线与生态壁垒。DSec 在统一接入层记录到了智能体试图覆写 shell 或探测宿主机控制套接字的攻击行为,但在具体实现中,微虚拟机内部示例依然使用了特权用户配置,缺少针对恶意逃逸与镜像快照污染的深度渗透证明。
- 风险.DSec 的存储提速高度绑定于 DeepSeek 专有的 3FS 共享文件系统,缺少公开发布的镜像与原型代码,外部工程团队即便面对相同痛点,也难以直接照搬其链路。
这套基础设施揭示了一个正在加速到来的工程分水岭:随着模型从单轮问答演进为与现实软件反复交互的系统实体,AI 基础设施的角力范围正迅速扩充到宿主机内核、网络文件系统与虚拟化边缘。DeepSeek 给出了止血的范本,但真正的生产考验才刚刚拉开序幕。
