互联网时代出现了大量的非结构化的数据,对数据的分布式存储和并行处理技术提出了很高的要求,大数据技术因此兴起。
移动互联网时代,移动应用远远比传统互联网更丰富、更普及,数据的结构也发生了很大的变化,对数据处理的性能和高并发的要求相比以前有巨大的提高,进一步推动了大数据交互查询和全文检索场景的发展。
到了即将爆发的物联网时代,任何信息都连接到网络上,我们需要将这些信息关联起来,发现其背后存在的规律,为人类的生活、生产创造更大的价值,这就是人工智能时代的大数据处理,需要提供低时延的实时处理能力,推动大数据技术进一步发展。
从大数据的发展趋势可以看出,大数据对于计算能力的要求越来越高,需要有更适合大数据技术特征的计算硬件来提供更高的计算能力。鲲鹏服务器的鲲鹏916系列处理器提供32核2.4GHz,鲲鹏920系列处理器提供24核2.6GHz、32核2.6GHz、48核2.6GHz、64核2.6GHz四种规格,均高于业界主流产品,鲲鹏系列处理器能高度匹配此类大数据业务场景。
鲲鹏BoostKit大数据场景(以下简称鲲鹏BoostKit大数据)针对大数据组件优化数据处理流程,提升计算并行度,充分发挥鲲鹏系列处理器的并发能力,给客户提供更高的大数据业务性能,支持鲲鹏服务器与业界其他架构服务器混合部署,保护客户已有投资,不捆绑客户的服务器架构选择。
鲲鹏BoostKit大数据场景针对大数据组件,优化数据处理流程,提升计算并行度,充分发挥鲲鹏系列处理器的并发能力,给客户提供更高的大数据业务性能。

大数据技术趋势:大数据分析效率、资源利用率驱动软硬一体化的架构创新
1、向量化技术加速,如Gluten+ClickHouse/Velox,或Databricks Delta Engine
2、软硬协同加速,可能重塑整个硬件加速使用方式,如Bigstream异构硬件加速产品
3、AI与大数据平台结合自提动化大数据平台运维,升资源利用率
大数据技术挑战:
多场景多组件,计算、I0效率低下,性能无法满足要求
1、查询多样化
实时计算、交互式分析、离线处理场景,每个场景涉及多个大数据组件
2、查询性能无法满足要求
大数据场景海量数据处理的需求与大数据组件计算、IO效率低下的矛盾,导致查询性能无法满足要求
鲲鹏BoostKit大数据总体架构主要由硬件平台、操作系统、中间件、大数据平台构成,其中大数据平台支持华为自研的FusionInsight大数据平台以及开源Apache、星环、苏研大数据平台。
鲲鹏BoostKit大数据支持多个大数据平台,包括离线分析、实时检索、实时流处理等多个场景。
离线分析,通常是指对T-1(即当前时间点的前一天)产生的海量数据进行分析和处理,形成结果数据,供下一步数据应用使用。离线处理对处理时间要求不高,但是所处理数据量较大,占用计算存储资源较多,通常通过MR或者Spark作业或者SQL作业实现。典型特点如下:
• 处理时间要求不高。
• 处理数据量巨大,PB级。
• 处理数据格式多样。
• 多个作业调度复杂。
• 占用计算存储资源多。
• 支持SQL类作业和自定义作业。
• 容易产生资源抢占。
实时检索,通常是指数据实时写入,对海量数据基于索引主键实时查询,查询响应时间要求较高,查询条件相对比较简单。查询条件复杂的可以根据关键词在全域数据中通过索引搜索主键后,通过主键查询。全域数据既包含了结构化数据又包含了文本数据。典型特点:
• 查询响应时间要求较高,毫秒级。
• 高并发。
• 处理数据量巨大,PB级。
• 能够同时处理结构化和非结构化的数据。
• 全文检索功能。
• 近实时索引。
实时流处理,通常是指对实时数据源进行快速分析,迅速触发下一步动作的场景。实时数据对分析处理速度要求极高,数据处理规模巨大,对CPU和内存要求很高,但是通常数据不落地,对存储量要求不高。实时处理,通常通过Storm、Spark Streaming或者Flink任务实现。典型特点:
• 处理时间要求极高,毫秒级。
• 处理数据量巨大,每秒数百兆。
• 占用计算资源多。
• 容易产生计算资源抢占。
• 数据格式以各种网络协议格式为主。
• 任务相对简单。
• 数据不落地、存储量不大。
鲲鹏BoostKit大数据使能套件:多维度加速,插件化解耦

• 高性能:多组件加速,不同场景性能30~80%1O
○ mniRuntime大数据组件多组件加速,插件化解耦交付(无需修改代码),提升不同场景大数据引擎性能30~80%;
○ 机器学习和图分析算法库,实现Spark性能5~20x提升
• 开箱最优:基础加速+基础调优
○ 参考实现基础性能调优,大数据性能与对位C1持平
○ openEuler+毕昇JDK提升组件性能10%
○ 鲲鹏内置压缩/解压缩加速引擎
• 兼容性好:
○ 全面支持开源大数据全面支持开源大数据,行业主流软件完成鲲鹏认证
○ 开源大数据组件支持x86和鲲鹏混合部署易使用:
• 插件式集成,业务无修改,易用性好
鯤鹏BoostKit大数据:使能大数据开源社区,适配主流开源软件
[案例]大数据平台支持鲲鹏与x86混合部署,现网集群实现平滑扩容
基础加速:
基础调优:基础性能优化,释放鲲鹏硬件算力

openEuler+毕昇JDK:计算组件平均性能提升10%
大数据TOP优化点
• ·磁盘/网卡队列调度策略优化
• ·Neon指令加速/编译优化
• ·AppCDS
• ·GC算法优化
OmniRuntime系列:全链路加速,提升大数据性价比
互联网时代出现了大量的非结构化的数据,对数据的分布式存储和并行处理技术提出了很高的要求,大数据技术因此兴起。
移动互联网时代,移动应用远远比传统互联网更丰富、更普及,数据的结构也发生了很大的变化,对数据处理的性能和高并发的要求相比以前有巨大的提高,进一步推动了大数据交互查询和全文检索场景的发展。
到了即将爆发的物联网时代,任何信息都连接到网络上,我们需要将这些信息关联起来,发现其背后存在的规律,为人类的生活、生产创造更大的价值,这就是人工智能时代的大数据处理,需要提供低时延的实时处理能力,推动大数据技术进一步发展。
从大数据的发展趋势可以看出,大数据对于计算能力的要求越来越高,需要有更适合大数据技术特征的计算硬件来提供更高的计算能力。鲲鹏服务器的鲲鹏916系列处理器提供32核2.4GHz,鲲鹏920系列处理器提供24核2.6GHz、32核2.6GHz、48核2.6GHz、64核2.6GHz四种规格,均高于业界主流产品,鲲鹏系列处理器能高度匹配此类大数据业务场景。
鲲鹏BoostKit大数据场景(以下简称鲲鹏BoostKit大数据)针对大数据组件优化数据处理流程,提升计算并行度,充分发挥鲲鹏系列处理器的并发能力,给客户提供更高的大数据业务性能,支持鲲鹏服务器与业界其他架构服务器混合部署,保护客户已有投资,不捆绑客户的服务器架构选择。
鲲鹏BoostKit大数据场景针对大数据组件,优化数据处理流程,提升计算并行度,充分发挥鲲鹏系列处理器的并发能力,给客户提供更高的大数据业务性能。
大数据技术趋势:大数据分析效率、资源利用率驱动软硬一体化的架构创新
1、向量化技术加速,如Gluten+ClickHouse/Velox,或Databricks Delta Engine
2、软硬协同加速,可能重塑整个硬件加速使用方式,如Bigstream异构硬件加速产品
3、AI与大数据平台结合自提动化大数据平台运维,升资源利用率
大数据技术挑战:
多场景多组件,计算、I0效率低下,性能无法满足要求
1、查询多样化
实时计算、交互式分析、离线处理场景,每个场景涉及多个大数据组件
2、查询性能无法满足要求
大数据场景海量数据处理的需求与大数据组件计算、IO效率低下的矛盾,导致查询性能无法满足要求
鲲鹏BoostKit大数据总体架构主要由硬件平台、操作系统、中间件、大数据平台构成,其中大数据平台支持华为自研的FusionInsight大数据平台以及开源Apache、星环、苏研大数据平台。
鲲鹏BoostKit大数据支持多个大数据平台,包括离线分析、实时检索、实时流处理等多个场景。
离线分析,通常是指对T-1(即当前时间点的前一天)产生的海量数据进行分析和处理,形成结果数据,供下一步数据应用使用。离线处理对处理时间要求不高,但是所处理数据量较大,占用计算存储资源较多,通常通过MR或者Spark作业或者SQL作业实现。典型特点如下:
• 处理时间要求不高。
• 处理数据量巨大,PB级。
• 处理数据格式多样。
• 多个作业调度复杂。
• 占用计算存储资源多。
• 支持SQL类作业和自定义作业。
• 容易产生资源抢占。
实时检索,通常是指数据实时写入,对海量数据基于索引主键实时查询,查询响应时间要求较高,查询条件相对比较简单。查询条件复杂的可以根据关键词在全域数据中通过索引搜索主键后,通过主键查询。全域数据既包含了结构化数据又包含了文本数据。典型特点:
• 查询响应时间要求较高,毫秒级。
• 高并发。
• 处理数据量巨大,PB级。
• 能够同时处理结构化和非结构化的数据。
• 全文检索功能。
• 近实时索引。
实时流处理,通常是指对实时数据源进行快速分析,迅速触发下一步动作的场景。实时数据对分析处理速度要求极高,数据处理规模巨大,对CPU和内存要求很高,但是通常数据不落地,对存储量要求不高。实时处理,通常通过Storm、Spark Streaming或者Flink任务实现。典型特点:
• 处理时间要求极高,毫秒级。
• 处理数据量巨大,每秒数百兆。
• 占用计算资源多。
• 容易产生计算资源抢占。
• 数据格式以各种网络协议格式为主。
• 任务相对简单。
• 数据不落地、存储量不大。
鲲鹏BoostKit大数据使能套件:多维度加速,插件化解耦
• 高性能:多组件加速,不同场景性能30~80%1O
○ mniRuntime大数据组件多组件加速,插件化解耦交付(无需修改代码),提升不同场景大数据引擎性能30~80%;
○ 机器学习和图分析算法库,实现Spark性能5~20x提升
• 开箱最优:基础加速+基础调优
○ 参考实现基础性能调优,大数据性能与对位C1持平
○ openEuler+毕昇JDK提升组件性能10%
○ 鲲鹏内置压缩/解压缩加速引擎
• 兼容性好:
○ 全面支持开源大数据全面支持开源大数据,行业主流软件完成鲲鹏认证
○ 开源大数据组件支持x86和鲲鹏混合部署易使用:
• 插件式集成,业务无修改,易用性好
鯤鹏BoostKit大数据:使能大数据开源社区,适配主流开源软件
[案例]大数据平台支持鲲鹏与x86混合部署,现网集群实现平滑扩容
基础加速:
基础调优:基础性能优化,释放鲲鹏硬件算力
openEuler+毕昇JDK:计算组件平均性能提升10%
大数据TOP优化点
• ·磁盘/网卡队列调度策略优化
• ·Neon指令加速/编译优化
• ·AppCDS
• ·GC算法优化
OmniRuntime系列:全链路加速,提升大数据性价比