---
title: 鲲鹏BoostKit大数据机器学习算法-鲲鹏社区
description: 兼容Spark原生API，在算法原理和鲲鹏亲和性方面做了深度优化，算法执行效率倍级提升
keywords: BoostKit,大数据机器学,习算法,鲲鹏社区,鲲鹏,Spark,API,兼容
url: https://www.hikunpeng.com/boostkit/big-data/machine-learning
section: (其他)
---

# 鲲鹏BoostKit大数据机器学习算法-鲲鹏社区

URL: https://www.hikunpeng.com/boostkit/big-data/machine-learning
描述: 兼容Spark原生API，在算法原理和鲲鹏亲和性方面做了深度优化，算法执行效率倍级提升
关键词: BoostKit,大数据机器学,习算法,鲲鹏社区,鲲鹏,Spark,API,兼容

鲲鹏应用使能套件BoostKit [了解详情](https://www.hikunpeng.com/zh/developer/boostkit)

鲲鹏 BoostKit 大数据使能套件 [了解详情](https://www.hikunpeng.com/zh/developer/boostkit/big-data)

鲲鹏BoostKit大数据机器学习算法

## 鲲鹏BoostKit大数据机器学习算法

### 兼容Spark原生API，在算法原理和鲲鹏亲和性方面做了深度优化，算法执行效率倍级提升

算法库下载 [了解详情](https://www.hikunpeng.com/zh/developer/download?title=%E5%A4%A7%E6%95%B0%E6%8D%AE&subTitle=%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0%E7%AE%97%E6%B3%95&zhTitle=%E5%A4%A7%E6%95%B0%E6%8D%AE&zhSubTitle=%E6%9C%BA%E5%99%A8%E5%AD%A6%E4%B9%A0%E7%AE%97%E6%B3%95&enTitle=Big+Data&enSubTitle=Machine+Learning+Algorithms)学习路径 [了解详情](https://www.hikunpeng.com/document/detail/zh/kunpengbds/appAccelFeatures/algorithmaccelf_ml/kunpengbds_learning_path.html)

## 机器学习算法库特性价值

### 鲲鹏BoostKit机器学习算法库是经过优化的算法库，兼容Spark原生API，对机器学习算法进行了性能优化，大幅提升了大数据算法场景的计算性能

高性能

相比开源算法，性能实现倍级提升，支持更大规模数据集

覆盖全

覆盖分类回归、特征工程、聚类、模式挖掘等常用算法类型

易部署

与原生Spark算法保持完全一致的类和接口定义，无需上层应用做任何修改

## 基于原生算法，做了哪些创新优化

鲲鹏亲和性能优化

算法原理优化

鲲鹏亲和性能优化

算法原理优化

...

鲲鹏亲和性优化

为了充分匹配和发挥鲲鹏架构的硬件优势，鲲鹏BoostKit从多核并行、访存优化等方面进行算法亲和性优化

多核并行计算

在树模型算法中，通过数据并行和模型并行相融合的方式，在通信量不变的情况下提升算法并行度，从而发挥鲲鹏的多核优势

访存优化

在PCA等算法中，需要计算大规模矩阵的格莱姆矩阵，BoostKit算法库利用鲲鹏Cache容量大的特点，对矩阵进行分块和重排，提升Cache命中率，进而提升访存效率

## 更新说明

版本号

发布时间

更新说明

3.0.0

2023-12-30

适配Spark 3.3.1，仅支持DBSCAN、Word2Vec、DTB、SVM这4个算法

2.2.0

2022-12-30

适配Spark 3.1.1，新增DecisionTree、 Random Forest、 GBDT这3个算法

新增算法：DTB、 Word2Vec, 适配Spark 2.3.2、Spark 2.4.5/2.4.6、Spark 3.1.1

2.1.0

2022-07-08

适配Spark 3.1.1，仅支持ALS、LDA、KNN、PrefixSpan、DBSCAN这5个算法

2.1.0

2022-04-08

新增算法：SPCA、IDF、SimRank

OS为openEuler-20.03-LTS-SP1，兼容Centos 7.6

1.3.0

2021-12-30

修改缺陷

1.3.0

2021-06-30

新增算法：Covariance、DBSCAN、Pearson相关系数、Spearman等级相关系数、XGBoost

OS由Centos 7.6切换为openEuler-20.03-LTS-SP1

大数据平台由Ambari+HDP切换为Apache

1.2.0

2021-03-30

新增算法： LDA、PrefixSpan、ALS和KNN

1.1.0

2020-12-11

新增算法：K-means、Descision Tree、Linear Regression、Logistic Regression、PCA和SVD

1.0.0

2020-11-30

支持的算法包括Random Forest、SVM、GBDT

## 快速使用算法库

准备集群环境

获取算法包

软件编译

软件安装

运行验证

根据集群实际部署场景，选择参考Spark鲲鹏集群环境部署 [了解详情](https://www.hikunpeng.com/document/detail/zh/kunpengbds/appAccelFeatures/algorithmaccelf_ml/kunpengbdssparkml_20_0020.html)或Spark混部集群部署 [了解详情](https://www.hikunpeng.com/document/detail/zh/kunpengbds/appAccelFeatures/algorithmaccelf_ml/kunpengbdssparkml_20_0024.html)

## 学习资源

介绍类：大数据进阶算法，分析性能提升20倍

介绍大数据进阶算法关键技术和创新点，并以GBDT算法为例演示了算法库的使用

查看详情 [了解详情](https://www.hikunpeng.com/zh/learn/courses-list/detail/381807401810923520)

操作类：如何安装机器学习算法加速库

以安装机器学习算法库1.3.0版本为例，使能机器学习算法库，验证其相比于原生算法的优化效果

查看详情 [了解详情](https://www.hikunpeng.com/zh/learn/courses-list/detail/384796158029860864)

相关文档

提供配套技术文档，帮助开发者深入了解算法库

技术白皮书 [了解详情](https://www.hikunpeng.com/document/detail/zh/kunpengbds/appAccelFeatures/algorithmaccelf_ml/kunpengbds_19_0006.html)调优指南 [了解详情](https://www.hikunpeng.com/document/detail/zh/kunpengbds/appAccelFeatures/algorithmaccelf_ml/kunpengbds_05_0006.html)验收测试指南 [了解详情](https://www.hikunpeng.com/document/detail/zh/kunpengbds/appAccelFeatures/algorithmaccelf_ml/kunpengbds_08_0006.html)特性指南 [了解详情](https://www.hikunpeng.com/document/detail/zh/kunpengbds/appAccelFeatures/algorithmaccelf_ml/kunpengbds_20_0006.html)开发指南 [了解详情](https://www.hikunpeng.com/document/detail/zh/kunpengbds/appAccelFeatures/algorithmaccelf_ml/kunpengbds_16_0006.html)

《基于鲲鹏的大数据挖掘算法实战》

面向鲲鹏生态高级开发者，提供典型算法实战赋能，帮助开发者基于鲲鹏处理器进行算法深度优化或二次开发

查看详情 [了解详情](https://item.jd.com/13540337.html)
