Slurm在鲲鹏集群上无法正确回收已结束作业的GPU资源
收藏回复举报
Slurm在鲲鹏集群上无法正确回收已结束作业的GPU资源
t('forum.solved') 已解决
发表于2026-04-21 23:38:26
0 查看

我们在鲲鹏集群中混用了GPU节点进行AI训练任务,调度系统是Slurm。节点配置是双路鲲鹏920加8张昇腾AI加速卡,操作系统openEuler。作业运行本身没有问题,但作业结束后出现了一个奇怪的现象:sinfo显示节点的可用GPU卡数没有恢复,比如原本有8张卡,跑了一个申请了2张卡的作业,作业结束后节点上仍然显示只有6张卡可用。用scontrol show node查看,发现被占用卡的GRES标记没有被清除。手动执行scontrol update nodename=节点名 state=idle可以恢复,但每次作业结束都要手动处理显然不现实。查看slurmd日志,作业结束时没有报错,但也没有看到释放GRES的记录。用常规CPU作业测试,作业结束后CPU核心数可以正常回收,说明问题只出现在GPU这类GRES资源上。想请教这种资源残留的问题该如何定位,是不是Slurm和昇腾驱动的某种交互在作业结束时没有正确触发释放回调。

我要发帖子