【背景】
HPC(High-performance computing,高性能计算)是能够执行一般电脑无法处理的大资料量与高速运算的并行计算系统,将大规模运算任务拆分并分发到各个服务器上进行并行运算,再将计算结果汇总得到最终结果,从而实现强大的计算功能。
HPC解决方案已经广泛应用于政府HPC、制造、气象、EDA等行业,但仍然面临诸多挑战:
- 工作流程不连续
传统高性能计算系统与用户现有的工作流程脱节。用户需要登录不同的终端分别进行数据处理和传输,没有统一的门户对仿真业务流程进行整合。
- 资源利用率较低
孤岛式的用户工作模式,每个用户在自己的桌面工作站上工作,并不利于协同作业,容易因为资源闲置而造成浪费。
- 集群规模小
集群规模小,需要多个集群才能支持业务,增加运维工作量,无法支撑大规模并行MPI作业。
- 集群吞吐量低,资源利用率低
集群吞吐量随集群规模的增大逐渐下降,当前开源或者商业的调度器架构陈旧,对新场景无法支持,造成一个业务一个集群,进一步降低资源利用率。
- MPI耗时
MPI通信耗时问题凸显,成为集群计算关键瓶颈。
为应对以上挑战,Kunpeng Computing HPC Solution应运而生。Kunpeng Computing HPC Solution通过自研线下集群统一监控和调度平台CCPortal(Cluster Computing Portal)、集群管理调度器CCScheduler(Cluster Computing Scheduler)和华为高性能通信库Hyper MPI,构建HPC集群核心软件系统,充分释放计算性能,实现智能集群管理与调度以及通讯接口性能优化。
【方案简介及优势】
Kunpeng Computing HPC Solution将大量服务器和存储设备通过高性能网络互联构建大规模计算集群,集群中各个计算节点相互协同并行处理多个子任务。这种并行计算的方式可以帮助解决普通计算机和服务器难以完成或无法快速完成的大型模型计算、复杂课题研究等问题。
Kunpeng Computing HPC Solution的优势如下:
- 集群统一监控和调度平台CCPortal
- 提供统一门户的集群管理软件。
- 提供界面友好的集群使用环境与功能完备的HPC运维管理系统。
- 构建完整HPC解决方案。
- 集群管理调度器CCScheduler
- 负责集群资源的统一管理和分配,调度作业运行,最大化的利用资源完成客户的各种类型的任务,加快客户的业务迭代。
- 支持MPI并行作业。
- 高资源利用率。
- 高性能通信库Hyper MPI
华为自研MPI,针对MPI通信TOP瓶颈,采用集合通信加速创新方案,性能逼近并逐渐超越业界最佳。
- 安全可靠
- 自研芯片、MPI、编译器、数学库等,掌握关键核心技术,提供产品可持续供应能力。
- 遵从商业环境要求,信息安全主动防护,保障客户放心部署应用。
- 提供三员管理+安全可信的信息安全高标准。
- 业务应用覆盖
制造、气象、EDA和政府HPC平台4个重点行业完成核心应用覆盖。
- 高性能
多调度器支持,业界首个提供异构调度器统一管理能力的高性能解决方案,支持HPC统一调度,华为智能网卡、SSD和GPU加速卡,加速高性能计算应用,提升客户应用性能表现。
- 开放生态
开放合作,兼容主流企业应用软件,支持丰富应用快速平滑移植,降低客户迁移成本。
【功能架构】
HPC功能架构分层结构如下图所示,针对各层HPC解决方案都有相应的产品布局。当前版本,继续提升应用移植与性能优化的数量;重点实现自研中间件软件栈的功能交付,HPC软件层具备商用销售能力。CCPortal主要实现应用中心与报表中心,支持作业提交、作业管理、应用集成、远程可视化、报表展示、计费等核心功能,对外提供简单易用的界面。CCScheduler是华为全自研的调度器,提供大规模集群下的高资源利用率、高吞吐量的作业调度能力。Hyper MPI实现Allreduce、Bcast、Barrier集合通信算法优化,小包场景下相比Intel MPI性能持平。使能x86服务器,集成OceanStor Pacific分布式存储系统,使能RoCE组网,支持解决方案集成交付。

【背景】
HPC(High-performance computing,高性能计算)是能够执行一般电脑无法处理的大资料量与高速运算的并行计算系统,将大规模运算任务拆分并分发到各个服务器上进行并行运算,再将计算结果汇总得到最终结果,从而实现强大的计算功能。
HPC解决方案已经广泛应用于政府HPC、制造、气象、EDA等行业,但仍然面临诸多挑战:
HPC应用行业复杂,多种类型软件并存,需持续升级。
数据频繁传输,效率和安全性问题需要保障。
需及时发现集群中的异常、实现多集群统一管理、用户异常行为监控,异常监控项多变。
传统高性能计算系统与用户现有的工作流程脱节。用户需要登录不同的终端分别进行数据处理和传输,没有统一的门户对仿真业务流程进行整合。
孤岛式的用户工作模式,每个用户在自己的桌面工作站上工作,并不利于协同作业,容易因为资源闲置而造成浪费。
集群规模小,需要多个集群才能支持业务,增加运维工作量,无法支撑大规模并行MPI作业。
集群吞吐量随集群规模的增大逐渐下降,当前开源或者商业的调度器架构陈旧,对新场景无法支持,造成一个业务一个集群,进一步降低资源利用率。
MPI通信耗时问题凸显,成为集群计算关键瓶颈。
为应对以上挑战,Kunpeng Computing HPC Solution应运而生。Kunpeng Computing HPC Solution通过自研线下集群统一监控和调度平台CCPortal(Cluster Computing Portal)、集群管理调度器CCScheduler(Cluster Computing Scheduler)和华为高性能通信库Hyper MPI,构建HPC集群核心软件系统,充分释放计算性能,实现智能集群管理与调度以及通讯接口性能优化。
【方案简介及优势】
Kunpeng Computing HPC Solution将大量服务器和存储设备通过高性能网络互联构建大规模计算集群,集群中各个计算节点相互协同并行处理多个子任务。这种并行计算的方式可以帮助解决普通计算机和服务器难以完成或无法快速完成的大型模型计算、复杂课题研究等问题。
Kunpeng Computing HPC Solution的优势如下:
华为自研MPI,针对MPI通信TOP瓶颈,采用集合通信加速创新方案,性能逼近并逐渐超越业界最佳。
制造、气象、EDA和政府HPC平台4个重点行业完成核心应用覆盖。
多调度器支持,业界首个提供异构调度器统一管理能力的高性能解决方案,支持HPC统一调度,华为智能网卡、SSD和GPU加速卡,加速高性能计算应用,提升客户应用性能表现。
开放合作,兼容主流企业应用软件,支持丰富应用快速平滑移植,降低客户迁移成本。
【功能架构】
HPC功能架构分层结构如下图所示,针对各层HPC解决方案都有相应的产品布局。当前版本,继续提升应用移植与性能优化的数量;重点实现自研中间件软件栈的功能交付,HPC软件层具备商用销售能力。CCPortal主要实现应用中心与报表中心,支持作业提交、作业管理、应用集成、远程可视化、报表展示、计费等核心功能,对外提供简单易用的界面。CCScheduler是华为全自研的调度器,提供大规模集群下的高资源利用率、高吞吐量的作业调度能力。Hyper MPI实现Allreduce、Bcast、Barrier集合通信算法优化,小包场景下相比Intel MPI性能持平。使能x86服务器,集成OceanStor Pacific分布式存储系统,使能RoCE组网,支持解决方案集成交付。