一、利用docker-compose
见之前华为鲲鹏服务器安装docker-compose及运用
二、利用Hadoop搭建Docker大数据处理集群


在Centos7上搭建数据分析集群过程包括:
2.1安装Docker与创建Hadoop镜像和三节点容器
2.1.1安装Dcoker
安装Docker对于Linux系统的要求是 64 位操作系统,内核版本至少为 3.10。

配置Docker加速器和开机启动服务
可以使用阿里云,华为云和daocloud使用方法都一样改registry-mirrors为对应的加速地址
2.2在Docker上创建Hadoop镜像
从Docker Hub官网仓库上获取centos镜像库
生成带有SSH功能的centos的镜像文件
为了后面配置各节点之间的SSH免密码登陆,需要在pull下的centos镜像库种安装SSH, 这里利用 Dockerfile 文件来创建镜像
根据上面的Dockerfile生成centos7-ssh镜像
生成Hadoop镜像库文件
在构建Hadoop镜像库的Dockerfile所在目录下,上传已经下载的 jdk-8u101-linux-x64.tar.gz, hadoop-2.7.3.tar.gz,Scala-2.11.8.tgz,spark-2.0.1-bin-hadoop2.7.tgz。
注意:这里要提前在Dockerfile文件配置环境变量,如果镜像库构建完成后,在容器中配置环境变量是不起作用的。
根据上面的Dockerfile构建Hadoop镜像库
生成三节点Hadoop容器集群
首先规划一下节点的主机名称,IP地址(局域网内构建docker镜像时,自动分配192.168.10.1/16网段的IP)和端口号
查看已创建的容器并更改hadoop和spark2.0.1目录所属用户
2.2在Docker上配置三节点Hdfs集群
开启三个容器终端
配置hdfs账号容器各节点间的SSH免密码登陆
分别进入master,slave01,slave02三个容器节点,执行下面命令
配置hadoop
这里主要配置hdfs,因为我们的计算框架要用spark,所以maprreduce的不需要配置。
进入master容器的hadoop配置目录,需要配置有以下7个文件:hadoop-env.sh,slaves,core-site.xml,hdfs-site.xml,maprd-site.xml,yarn-site.xml
启动HDFS集群,验证是否搭建成功
启动HDFS和yarn,Hadoop状态正常

cpu使用情况:可以发现单节点环境中,不存在网络间通信情况,不存在网络达到瓶颈的问题;cpu使用量也未达到瓶颈,仅仅是磁盘有少量使用

浏览器输入http://本机ip地址:8080 ,可以浏览hadoop node管理界面
2.3在Docker上配置三节点Yarn集群
上面已经配置成功,直接启动yarn集群
浏览器输入http://本机ip地址:8088/cluster 可以浏览节点;

2.4在Docker上配置三节点spark集群
配置spark
进入master容器的spark配置目录,需要配置有两个文件:spark-env.sh,slaves
启动spark集群
浏览Spark的Web管理页面: http://本机ip地址:8080
一、利用docker-compose
见之前华为鲲鹏服务器安装docker-compose及运用
二、利用Hadoop搭建Docker大数据处理集群
在Centos7上搭建数据分析集群过程包括:
在Cnetos7上安装Docker并创建Hadoop镜像和三节点容器
在Docker上配置三节点Hdfs集群
在Docker上配置三节点Yarn集群
在Docker上配置三节点Spark集群
2.1安装Docker与创建Hadoop镜像和三节点容器
2.1.1安装Dcoker
安装Docker对于Linux系统的要求是 64 位操作系统,内核版本至少为 3.10。
配置Docker加速器和开机启动服务
可以使用阿里云,华为云和daocloud使用方法都一样改
registry-mirrors为对应的加速地址sudo mkdir -p /etc/docker sudo tee /etc/docker/daemon.json <<-'EOF' { "registry-mirrors": ["http://f1361db2.m.daocloud.io"] } EOF sudo systemctl daemon-reload sudo systemctl restart docker2.2在Docker上创建Hadoop镜像
从Docker Hub官网仓库上获取centos镜像库
生成带有SSH功能的centos的镜像文件
为了后面配置各节点之间的SSH免密码登陆,需要在pull下的centos镜像库种安装SSH, 这里利用 Dockerfile 文件来创建镜像
根据上面的Dockerfile生成centos7-ssh镜像
生成Hadoop镜像库文件
在构建Hadoop镜像库的Dockerfile所在目录下,上传已经下载的 jdk-8u101-linux-x64.tar.gz, hadoop-2.7.3.tar.gz,Scala-2.11.8.tgz,spark-2.0.1-bin-hadoop2.7.tgz。
注意:这里要提前在Dockerfile文件配置环境变量,如果镜像库构建完成后,在容器中配置环境变量是不起作用的。
根据上面的Dockerfile构建Hadoop镜像库
生成三节点Hadoop容器集群
首先规划一下节点的主机名称,IP地址(局域网内构建docker镜像时,自动分配192.168.10.1/16网段的IP)和端口号
查看已创建的容器并更改hadoop和spark2.0.1目录所属用户
2.2在Docker上配置三节点Hdfs集群
开启三个容器终端
配置hdfs账号容器各节点间的SSH免密码登陆
分别进入master,slave01,slave02三个容器节点,执行下面命令
配置hadoop
这里主要配置hdfs,因为我们的计算框架要用spark,所以maprreduce的不需要配置。
进入master容器的hadoop配置目录,需要配置有以下7个文件:hadoop-env.sh,slaves,core-site.xml,hdfs-site.xml,maprd-site.xml,yarn-site.xml
启动HDFS集群,验证是否搭建成功
启动HDFS和yarn,Hadoop状态正常
cpu使用情况:可以发现单节点环境中,不存在网络间通信情况,不存在网络达到瓶颈的问题;cpu使用量也未达到瓶颈,仅仅是磁盘有少量使用
浏览器输入http://本机ip地址:8080 ,可以浏览hadoop node管理界面
2.3在Docker上配置三节点Yarn集群
上面已经配置成功,直接启动yarn集群
浏览器输入http://本机ip地址:8088/cluster 可以浏览节点;
2.4在Docker上配置三节点spark集群
配置spark
进入master容器的spark配置目录,需要配置有两个文件:spark-env.sh,slaves
启动spark集群
浏览Spark的Web管理页面: http://本机ip地址:8080