本案例Demo用到了GBDT算法,涉及决策树训练过程中节点的分裂,关键是需要寻找训练数据特征值的最佳分割点,例如影响全球健康度预测的特征值包括人均GDP、受教育程度、酗酒程度等。鲲鹏BoostKit机器学习算法库对计算分割点的过程进行优化,在百万级和千万级数据集上,端到端训练速度提升了1~3倍。
原生算法

在不同计算节点上对数据集进行分割点计算,然后将每个节点的计算结果合并到一起,得出最佳分割点,消耗大量的网络通信的时间
优化后的算法

在同一计算节点上计算一个特征的最佳分割点,通过并行模式等价变换训练过程,在不影响精度的情况下消除通信热点,提升算法性能


