坐拥数千张英伟达旗舰算力卡的艾伦人工智能研究所(Ai2),近日对内部集群调度体系动了一场大手术。面对管理跨度在88卡到1024卡之间的英伟达H100、B200及B300集群,以及约150名研究人员提出的2至3倍超额算力需求,Ai2彻底废弃了沿用多年的优先级队列,转向由GPU时间预算、层级式公平共享及分时契约构成的全新调度架构。

这不仅是一次底层配置的升级,更标志着AI实验室在资源枯竭面前,被迫将算力分配从工程运维协商重组为自上而下的行政预算制。当大模型预训练、具身智能模拟与科学智能微调同时争夺同一批高带宽内存卡槽,技术调度器已经无法调和人性博弈,唯一的出路是用微观经济学手段给算力立规矩。

危机现场:150名研究员与优先级通胀的博弈死局

在旧系统崩溃前,Ai2的算力集群是一个典型的公地悲剧样本。由于训练需求长期超出物理承载能力的2至3倍,研究员为了在排队时不被延宕,自发找到了系统的防御漏洞。

最普遍的操作是占座。许多算法研究员为了能够低延迟切入调试环节,会在空闲卡上提交不执行实际运算的挂机任务,以此强行霸占显存。更为致命的是优先级通胀,当系统允许申请不可抢占的高优先级配额时,每个人都有动机把任务标为最高级别。最终,集群内100%的提交任务全部变成了紧急状态,多级优先级彻底失效,低级别实验全面停摆。

与传统高性能计算平台依靠Slurm的TRES多因子机制计费、或者云原生K8s借助Kueue的借调队列管控不同,这些成熟方案大多长于瞬时节点放置与准入抢占,却普遍缺乏面向组织按月度、季度下发的时间账本。这导致基础设施团队的当班工程师苦不堪言,大量工时不是用来排查硬件故障,而是在群聊和工单系统里人工劝说研究员交出有缺陷节点的控制权。

算力公地治理逻辑转向 旧系统:技术排队与博弈败局 · 零成本提权导致 100% 任务涌向最高级 · 空转挂机霸占卡槽,故障节点下线难 · SRE 沦为协调纠纷的人肉中介 新系统:央行式时间配额契约 · 自上而下按项目逐级注资时间预算 · 契约保底运行时长,到期强制分时切片 · 挂机空转自损额度,博弈成本内生化

机制重构:把调度器做成7天周期的算力央行

为了击穿博弈链条,Ai2借鉴了经典的Dominant Resource Fairness理论,不再分配固定的机器所有权,而是像风险投资委员会一样,给项目分配GPU时间额度。

机柜托架边缘的倒计时墨水屏严格限制任务受保护时长
机柜托架边缘的倒计时墨水屏严格限制任务受保护时长

这套系统的运转依托于三大核心构件。管理层将总算力预算逐层批复给项目PI与负责人,任务在申请时必须携带合法账本;调度器默认以7天滑动回溯窗口动态核算实际占用,长期欠费的项目会被压低调度权重,长期轻载的团队则获得临时突发借调额度。

最关键的设计在于引入分时契约。提交任务必须明确声明最短受保护运行时长,对于探索性交互会话,系统硬性规定了8小时保护上限。在受保护窗口内,任务不可被抢占,一旦窗口走完,系统有权将其挂起重排。如果研究员把最短时长声明为零,该任务完全不扣减项目预算,代价是成为最底层算力,随时会被正规军驱逐。

Ai2 集群治理关键落盘指标 24 秒 旗舰 H100 排队中位数(原 5 分钟) 98% 全集群出租率与预算兑现率 74% 硬件维修人工介入降幅

在连续30天的运行实测中,这种算力紧缩与契约化调度带来了显著的账面改观。Ai2最大的英伟达H100集群上,排队等待时间中位数直接从过去的5分钟大幅骤降至24秒。全集群在兑现98%应分配时长的同时,整体出租率同样维持在98%的高位。当坏节点在保护窗口结束后能自动清退任务,运维工程师需要肉身介入的维修工单量骤降了74%。

  • 结论.当抢占与额度挂钩,占座空转消耗的是本组真实经费,机制迫使研究员从向管理员哭穷转向自觉提升脚本紧凑度。

隐性代价:98%出租率背后的检查点损耗与权力转移

但在亮眼的统计数字之下,高密度抢占也给分布式训练带来了工程层面的隐性磨损。

高频读写检查点让固态硬盘满载,而计算核心被迫等待
高频读写检查点让固态硬盘满载,而计算核心被迫等待

账面上的高出租率并不完全等同于实际计算吞吐量。在分时契约模式下,长周期模型训练被拆碎成多个受保护切片,一旦保护期结束并触发调度换座,上百个计算卡必须同步将庞大的模型权重与优化器状态写入存储检查点。重新恢复排队并启动时,又需要重新拉取数十吉字节的状态镜像,进行漫长的节点通信握手与预热。这些耗费在I/O上的等待,全被包裹在98%的出租率光环之下。

账面高出租率可能掩盖真实计算损耗,分时抢占的代价全由检查点开销买单。
分时契约生命周期管道 1. 提交契约 声明最短运行时长 2. 受保护运行 扣减预算,豁免抢占 3. 到期重排与归档 写检查点,释放拓扑 4. 动态回收/修复 故障主机自动化清退

与此同时,拓扑碎片化成了规模化并行的新阻碍。大模型分布式预训练通常需要数百张在NVLink直连域内的连续节点,而大量保护时长不一的小任务穿插在集群中,使得调度器极难在同一时间缝隙拼凑出平整的超大网络拓扑。

组织权力的集中同样是一柄双刃剑。技术指标被拉平后,谁能拿到算力,完全取决于管理层对项目战略价值的主观裁量。8小时的交互上限让习惯在终端中长期微调参数的探索性研究步履维艰,一旦无法通过正式提案拿到预算,冷门或前沿的科学尝试就会失去立足之地。

  • 风险.当算法调度器退化为单纯的预算记账工具,过度制度化可能扼杀非共识的早期探索,实验室需警惕从技术无序滑向行政僵化。