我们搭建了一套基于鲲鹏920的HPC集群,共有16个节点,每个节点是双路配置、一共128个物理核心,操作系统是麒麟V10。调度系统用的是PBS Professional 19.2。部署完成后发现一个很奇怪的现象:提交作业时如果用select=1:ncpus=128请求整个节点的全部核心,作业可以正常运行;但如果请求的是部分核心,比如select=1:ncpus=64,作业虽然能启动,但实际只跑在了32个核心上,剩下的32个核心在节点上完全是空闲状态。用pbsnodes查看节点资源,显示的ncpus是128,resources_available.ncpus也是128,看起来都没错。在作业脚本里绑定核心或者使用place=scatter也没有改善。我们也试过直接在一台节点上运行pbs_mom -d重新注册,依然无效。想请问这种情况是PBS在ARM架构上的适配问题,还是我们在配置节点属性时漏掉了什么关键参数。
我们搭建了一套基于鲲鹏920的HPC集群,共有16个节点,每个节点是双路配置、一共128个物理核心,操作系统是麒麟V10。调度系统用的是PBS Professional 19.2。部署完成后发现一个很奇怪的现象:提交作业时如果用select=1:ncpus=128请求整个节点的全部核心,作业可以正常运行;但如果请求的是部分核心,比如select=1:ncpus=64,作业虽然能启动,但实际只跑在了32个核心上,剩下的32个核心在节点上完全是空闲状态。用pbsnodes查看节点资源,显示的ncpus是128,resources_available.ncpus也是128,看起来都没错。在作业脚本里绑定核心或者使用place=scatter也没有改善。我们也试过直接在一台节点上运行pbs_mom -d重新注册,依然无效。想请问这种情况是PBS在ARM架构上的适配问题,还是我们在配置节点属性时漏掉了什么关键参数。