华为计算微信公众号
华为计算微博
华为计算今日头条
图中的STRSM效率正常吗?通过OMP_PROC_BIND和MPI rankfile进行绑核后,性能也类似。据说STRSM在8 cores+绑核能达到90%峰值效率,但我的测试结果只能到70%,可能是现在的矩阵规模太小了?
STRSM的两个矩阵规模分别为1024x1024,1024xN。1个进程映射到1个NUMA,32核。峰值效率计算公式为 实测GFLOPS/理论单精度峰值性能GFLOPS。
本帖最后由 匿名用户 于 2023/11/16 15:33:08 编辑
我要发帖子
图中的STRSM效率正常吗?通过OMP_PROC_BIND和MPI rankfile进行绑核后,性能也类似。据说STRSM在8 cores+绑核能达到90%峰值效率,但我的测试结果只能到70%,可能是现在的矩阵规模太小了?
STRSM的两个矩阵规模分别为1024x1024,1024xN。1个进程映射到1个NUMA,32核。峰值效率计算公式为 实测GFLOPS/理论单精度峰值性能GFLOPS。