华为计算微信公众号
华为计算微博
华为计算今日头条
# 节点配置示例 CPU: Kunpeng 920 (64核@2.6GHz) 内存: 2TB DDR4-3200 (8通道) 存储: 24x 3.84TB NVMe SSD RAID10 网络: 200Gbps InfiniBand + 100Gbps RoCEv2
我要发帖子
核心问题清单
1. 超大规模集群调度效率瓶颈- 现象:作业提交后平均等待时间超过15分钟,资源利用率仅65%
- 尝试方案:
- 已启用多瑙调度器的抢占式调度策略
- 配置了CPU/Memory/NUMA亲和性策略
- 待解问题:
- 如何优化调度策略应对突发性计算任务洪峰?
- 是否支持基于机器学习的历史负载预测调度?
2. 异构计算资源协同管理- 架构:混合部署鲲鹏+AMD EPYC计算节点
- 痛点:
- OpenFOAM作业在AMD节点运行时出现MPI通信异常
- 不同架构节点间的存储I/O性能差异显著
- 求助方向:
- 是否有成熟的异构集群资源调度方案?
- 如何统一不同架构节点的SLURM配置参数?
3. 存储网络性能优化- 配置:
- 采用NFS+CEPH混合存储架构
- 网络层使用RoCEv2+InfiniBand混合组网
- 异常现象:
- 大文件读写时出现网络拥塞(iperf3测试带宽仅达理论值60%)
- Ceph OSD日志频繁报"slow metadata requests"
- 已尝试:
- 调整IB交换机MTU为9000
- 启用Ceph的CRUSH算法优化
- 待突破:
- 如何定位网络拥塞的具体发生节点?
- 是否有鲲鹏平台专用的网络调优参数?
4. 关键应用性能调优补充信息
期待解决方案