Slurm在鲲鹏集群上频繁出现作业卡在PD状态无法调度
收藏回复举报
Slurm在鲲鹏集群上频繁出现作业卡在PD状态无法调度
t('forum.solved') 已解决
发表于2026-04-05 15:53:52
0 查看

我们的鲲鹏计算集群有32个节点,每个节点双路鲲鹏920,操作系统是openEuler,调度器用的是Slurm。集群部署完成之后,提交测试作业时一切正常,但开始正式跑任务没多久就出问题了。用户反映提交的作业长时间处于PD(待运行)状态,squeue看原因是资源不足,但实际用sinfo查看节点状态,大部分节点都是空闲的。偶尔重启slurmctld服务后,那些卡住的作业能正常调度出去,但运行一段时间后又会复现。查看slurmctld日志,能看到大量类似“节点未响应”、“注册超时”的警告信息,但这些节点通过ping和ssh都是正常的。我们检查过时钟同步,ntp服务运行正常,所有节点的时间差在毫秒级别。也试过调整Slurm的节点健康检查超时参数,问题仍然存在。想请教这种现象在鲲鹏集群上是否常见,应该从哪个方向去排查。

我要发帖子