开发者
资源
鲲鹏集群存储分层架构设计与性能优化实战
鲲鹏集群存储分层架构设计与性能优化实战
发表于02/03
3830

在鲲鹏 HPC 集群中,存储系统是连接计算节点与数据资源的核心枢纽,其性能直接决定 HPC 任务的整体运行效率 —— 尤其对于 WRF 气象模拟、LAMMPS 分子动力学模拟、有限元分析等场景,需频繁读写海量大文件(如气象初始场数据、轨迹文件)与小文件(如元数据、参数配置文件),对存储的吞吐量、IO 时延、容量扩展性提出了极高要求。传统鲲鹏 HPC 集群多采用单一存储架构(如纯 Lustre 并行文件系统),无法兼顾大文件并行读写、小文件元数据高效访问与存储成本的平衡,易出现存储瓶颈与资源浪费。本文聚焦鲲鹏集群的存储分层架构设计,结合科研与工程实战场景,从分层架构选型、各层性能优化、数据迁移策略、运维监控四个维度,分享可落地的存储优化方案,实现存储性能、容量与成本的三维平衡,为鲲鹏 HPC 集群提供高效、稳定的存储支撑。

鲲鹏 HPC 集群存储系统的核心痛点,源于存储架构与 HPC 任务数据特性的不匹配,以及存储资源与计算资源的协同不足。一方面,HPC 任务的数据类型呈现 “两极分化”:大文件(单文件 GB 级以上)占比高(约 70%-80%),需高吞吐量、低时延的并行存储支撑;小文件(单文件 KB 级以下)数量多(百万级以上),需高效的元数据管理与低时延访问;同时,部分冷数据(如历史模拟结果、归档数据)访问频率低,无需高性能存储资源,仅需满足容量需求与数据安全性。传统单一存储架构无法适配这种多样化数据需求:纯 Lustre 架构虽能满足大文件并行读写,但小文件元数据 IO 瓶颈突出,且存储成本较高;纯分布式文件系统(如 Ceph)虽具备良好的扩展性,但大文件吞吐量不足,无法匹配鲲鹏集群的计算性能;纯本地存储虽时延低,但容量有限、数据无法共享,无法支撑大规模分布式并行计算。另一方面,鲲鹏集群的存储系统与计算节点、网络系统协同不足,存储 IO 调度未适配鲲鹏多队列 IO 控制器,网络带宽未充分利用,导致存储性能无法与计算性能协同释放,出现 “计算节点闲置、存储 IO 阻塞” 的失衡状态。此外,存储系统缺乏灵活的数据迁移与分层管理机制,冷数据占用高性能存储资源,热数据无法优先获得存储算力,进一步加剧存储瓶颈。

一、鲲鹏集群存储分层架构选型:适配多样化数据需求

结合鲲鹏 HPC 集群的计算特性与 HPC 任务的数据需求,设计 “三级分层存储架构”,自上而下分为高性能并行存储层、容量型分布式存储层、冷数据归档层,各层各司其职、协同联动,兼顾性能、容量与成本,适配不同类型数据的存储需求,充分发挥鲲鹏架构的硬件优势。

(一)高性能并行存储层(热数据层)

该层作为存储架构的核心,主要承载热数据(如正在运行的 HPC 任务的中间结果、高频访问的大文件与小文件元数据),核心需求是高吞吐量、低时延、高并发,适配鲲鹏集群的多核高并发与多队列 IO 特性。选型方面,优先采用 Lustre 并行文件系统(鲲鹏优化版),搭配 NVMe SSD 硬盘组建存储节点,充分利用 NVMe SSD 的高 IOPS(百万级)与低时延(微秒级)优势,同时结合鲲鹏 920/930 处理器的多队列 IO 控制器,提升存储 IO 处理效率。架构设计上,采用 “多 MDT(元数据服务器)+ 多 OSS(对象存储服务器)” 部署模式:MDT 节点负责元数据管理,采用主备架构保障高可用,同时启用元数据缓存优化,提升小文件元数据访问效率;OSS 节点负责数据存储与 IO 读写,每个 OSS 节点搭载多块 NVMe SSD 硬盘,组建 RAID 0 阵列(优先保障吞吐量),多个 OSS 节点并行工作,提升大文件并行读写吞吐量。该层的存储容量根据热数据量动态配置,建议占总存储容量的 20%-30%,重点保障 HPC 任务的实时 IO 需求。

(二)容量型分布式存储层(温数据层)

该层主要承载温数据(如近期完成的 HPC 任务结果、访问频率中等的大文件、批量小文件),核心需求是

收藏举报
Level 1
0
帖子
0
粉丝
0
获赞