Token导航 LogoToken导航

DeepSeek公开Agent训练沙盒DSec论文

更新时间 2026-09-27来源 AI先锋官官方正文 2037字阅读约 7分钟

9月19日,DeepSeek 在 arXiv 上提交了一篇31页的系统论文《DeepSeek Elastic Compute(DSec):面向大规模 Agent 训练的沙盒基础设施》,作者超过130人,DeepSeek 创始人梁文锋署名其中。

论文第一次系统公开了 DeepSeek 用来支撑大规模 Agent 训练的沙盒平台 DSec。

它不是一个新模型,甚至不是大家通常理解的“AI 产品”,而更像是一座给 AI 准备“电脑”的工厂。

过去训练大模型,最核心的东西是 GPU。模型输入一段文字,输出一个答案,然后计算奖励,再继续训练。

但 Agent 不一样。

如果让一个 AI 自己完成编程任务,它需要先打开代码仓库,读取文件,运行命令,安装软件包,修改代码,运行测试,再根据结果继续修改。

这时候,AI 不仅需要“大脑”,还需要一台真正可以操作的“电脑”。

这台电脑不能和其他 Agent 混在一起,要有自己的文件、软件、网络和运行环境;任务结束后,还要能够保存下来、恢复、复制或者直接销毁。

问题在于,一旦同时训练几千、几万甚至几十万个 Agent,需要的就不再是几台电脑,而是一整座“电脑工厂”。

DSec就是干这个的。

论文披露,一个生产单元大约由160个 CPU 节点、3万核 CPU 和约250TB 内存组成,管理 PB 级的镜像和环境。

每天大约服务300万个沙盒,峰值同时运行超过38万个,创建速度超过每秒5000个。单个训练任务最多可以一次拉起3.2万个沙盒。

注意,这里的38万个,不是38万个模型,而是38万个给 Agent 使用的独立运行环境。

可以把它想象成,同一时间、几十万个 AI 员工各自坐在几十万台电脑前干活。

而且这些“电脑”并不只有一种。

DSec把函数调用、容器、microVM,以及完整虚拟机等不同类型的执行环境,统一到了一套接口里。简单任务可以用轻量环境,需要更强隔离时则可以使用更重的虚拟机。

真正麻烦的是,这些 Agent 特别能折腾。

一个 Agent 写完代码可能会安装新的软件,修改系统文件,产生大量临时数据,甚至把自己的运行环境搞坏。下一轮任务又可能需要完全不同的软件和依赖。

如果每次都重新制作一台“电脑”,速度和成本都受不了。

DSec的办法,是把环境拆成不同层,需要什么再组合什么。

比如基础操作系统是一层,工作区是一层,工具和软件环境又是一层。大量数据不需要每次完整复制,而是通过 DeepSeek 自己的3FS分布式文件系统按需读取。

论文实验显示,在大规模启动环境时,这种按需加载方式可以明显减少镜像分发和磁盘写入开销;生产环境中,一台节点最高可以承载约800个 microVM,或者3200个容器。

为什么可以塞这么多?因为 Agent 很多时候其实没有一直“干活”。它可能执行完一个命令,就在那里等大模型生成下一步指令。这意味着 CPU 经常处于低利用率状态。

于是 DSec采用了资源超卖、内存共享、回收和 CPU 调度等办法,把原本闲置的资源继续给其他 Agent 使用,同时尽量保证真正需要计算的任务不会因为资源争抢而明显变慢。

这其实是 DSec 最核心的思路之一:不是给每个 Agent 永久配一台电脑,而是像云计算一样,动态地给它们制造和回收电脑。

但这还不是最有意思的地方。

论文专门花了一部分篇幅讨论一个听起来有点离谱的问题:训练中的 Agent,会不会自己作弊?答案是,会。

因为强化学习的目标是获得更高 reward。只要 Agent 找到了比“老老实实完成任务”更容易拿到高分的方法,它就可能尝试走捷径。

论文记录了不少这类行为。

有 Agent 会搜索系统文件和日志,寻找可能泄露答案的信息;有的会尝试绕过权限控制;有的会扫描网络端口,寻找隐藏服务;还有 Agent 尝试修改系统组件,甚至出现破坏文件系统的情况。

换句话说,当 AI 被允许真正操作一台电脑之后,它面对的就不只是“完成任务”这一条路。

它还可能开始研究这台电脑有什么漏洞?哪里可能藏着答案?能不能绕过限制?能不能直接修改环境,让自己得到更高的 reward?

所以,给 Agent 的“电脑”不仅要快,还必须足够安全。

这也是为什么 DSec不只是一个沙盒启动器。

它同时负责环境隔离、权限控制、网络访问、状态保存、资源回收和异常行为处理。

还有一个重要问题是,Agent 的工作不能因为 GPU 训练任务被抢占就全部重来。

传统强化学习训练中,GPU资源可能被其他任务抢占。如果 Agent 的执行状态和 GPU 训练绑死,那么一次抢占可能意味着之前几十分钟甚至更长时间的工作全部浪费。

DSec把 Agent 的 rollout 环境和容易被抢占的 GPU 训练任务分开。

Agent 在自己的沙盒里继续保持状态,GPU训练任务暂停或者切换之后,再重新连接回来即可继续,而不需要把之前执行过的操作全部重新播放。

如此种种,DeepSeek 这篇论文大概揭示出了,当 AI 从“回答问题”变成“自己干活”,基础设施会发生什么变化?

以前 AI 训练是在造“大脑”,现在还得开始造“身体”。而 DSec,就是 DeepSeek 给这些 AI Agent 准备的那套“身体”。

资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多