使用docker部署hadoop叢集

upupfeng發表於2020-09-04

DockerHadoop

最近要在公司裡搭建一個hadoop測試叢集，於是採用docker來快速部署hadoop叢集。

0. 寫在前面

網上也已經有很多教程了，但是其中都有不少坑，在此記錄一下自己安裝的過程。

目標：使用docker搭建一個一主兩從三臺機器的hadoop2.7.7版本的叢集

準備：

首先要有一臺記憶體8G以上的centos7機器，我用的是阿里雲主機。
其次將jdk和hadoop包上傳到伺服器中。

我安裝的是hadoop2.7.7。包給大家準備好了，連結：https://pan.baidu.com/s/15n_W-1rqOd2cUzhfvbkH4g 提取碼：vmzw。

1. 步驟

大致分以下幾步：

安裝docker
基礎環境準備
配置網路，並啟動docker容器
配置host及ssh免密登入
安裝配置hadoop
測試使用hadoop

1.1 安裝docker

依次執行如下步驟安裝docker。如果有docker環境的可以跳過。

yum update

yum install -y yum-utils device-mapper-persistent-data lvm2

yum-config-manager --add-repo http://mirrors.aliyun.com/docker-ce/linux/centos/docker-ce.repo

yum install -y docker-ce
 
systemctl start docker

docker -v

1.2 基礎環境準備

1.2.1 建立基礎的centos7映象

拉取官方centos7映象

docker pull centos

通過build Dockfile生成帶ssh功能的centos映象

建立Dockerfile檔案

vi Dockerfile

將如下內容寫入Dockerfile

FROM centos
MAINTAINER mwf

RUN yum install -y openssh-server sudo
RUN sed -i 's/UsePAM yes/UsePAM no/g' /etc/ssh/sshd_config
RUN yum  install -y openssh-clients

RUN echo "root:qwe123" | chpasswd
RUN echo "root   ALL=(ALL)       ALL" >> /etc/sudoers
RUN ssh-keygen -t dsa -f /etc/ssh/ssh_host_dsa_key
RUN ssh-keygen -t rsa -f /etc/ssh/ssh_host_rsa_key

RUN mkdir /var/run/sshd
EXPOSE 22
CMD ["/usr/sbin/sshd", "-D"]

上述內容大概意思是：以centos映象為基礎，設定密碼為wqe123，安裝ssh服務並啟動

構建Dockerfile
```
docker build -t="centos7-ssh" .
```
將生成一個名為centos7-ssh的映象，可以通過docker images檢視

1.2.2 生成有hadoop和jdk環境的映象

將準備好的包放在當前目錄下。hadoop-2.7.7.tar.gz和jdk-8u202-linux-x64.tar.gz
通過build Dockfile生成帶hadoop和jdk環境的centos映象

剛才已經建立了一個Dockerfile了，先將他移開。mv Dockerfile Dockerfile.bak

建立Dockerfile

vi Dockerfile

將以下內容寫入：

FROM centos7-ssh
ADD jdk-8u202-linux-x64.tar.gz /usr/local/
RUN mv /usr/local/jdk1.8.0_202 /usr/local/jdk1.8
ENV JAVA_HOME /usr/local/jdk1.8
ENV PATH $JAVA_HOME/bin:$PATH

ADD hadoop-2.7.7.tar.gz /usr/local
RUN mv /usr/local/hadoop-2.7.7 /usr/local/hadoop
ENV HADOOP_HOME /usr/local/hadoop
ENV PATH $HADOOP_HOME/bin:$PATH

RUN yum install -y which sudo

上述內容大概意思是：以上面生成的centos7-ssh為基礎，將hadoop和jdk包放進去，然後配好環境變數。

構建Dockerfile
```
docker build -t="hadoop" .
```
將生成一個名為hadoop的映象

1.3 配置網路，並啟動docker容器

因為叢集間必須要能網路連通，所以要先配置好網路。

建立網路
```
docker network create --driver bridge hadoop-br
```
以上命令建立了一個名為hadoop-br的bridge型別的網路

啟動docker時指定網路

docker run -itd --network hadoop-br --name hadoop1 -p 50070:50070 -p 8088:8088 hadoop
docker run -itd --network hadoop-br --name hadoop2 hadoop
docker run -itd --network hadoop-br --name hadoop3 hadoop

以上命令啟動了3臺機器，網路都指定為hadoop-br，hadoop1還開啟了埠對映。

檢視網路情況

docker network inspect hadoop-br

執行以上命令就可以看到對應的網路資訊：

[
    {
        "Name": "hadoop-br",
        "Id": "88b7839f412a140462b87a353769e8091e92b5451c47b5c6e7b44a1879bc7c9a",
        "Containers": {
"86e52eb15351114d45fdad4462cc2050c05202554849bedb8702822945268631": {
                "Name": "hadoop1",
                "IPv4Address": "172.18.0.2/16",
                "IPv6Address": ""
            },
            "9baa1ff183f557f180da2b7af8366759a0d70834f43d6b60fba2e64f340e0558": {
                "Name": "hadoop2",
                "IPv4Address": "172.18.0.3/16",
                "IPv6Address": ""
            },  "e18a3166e965a81d28b4fe5168d1f0c3df1cb9f7e0cbe0673864779b224c8a7f": {
                "Name": "hadoop3",
                "IPv4Address": "172.18.0.4/16",
                "IPv6Address": ""
            }
        },
    }
]

我們可以得知3臺機器對應的ip：

172.18.0.2 hadoop1 
172.18.0.3 hadoop2 
172.18.0.4 hadoop3

登入docker容器，互相之間就可以ping通了。

docker exec -it hadoop1 bash
docker exec -it hadoop2 bash
docker exec -it hadoop3 bash

1.4 配置host及ssh免密登入

1.4.1 配置host

分別在每臺修改每臺機器的host

vi /etc/hosts

將以下內容寫入（注：docker分出來的ip對於每個人可能不一樣，填你自己的）：

172.18.0.2 hadoop1 
172.18.0.3 hadoop2 
172.18.0.4 hadoop3

1.4.2 ssh免密登入

因為上面在映象中已經安裝了ssh服務，所以直接分別在每臺機器上執行以下命令：

ssh-keygen
一路回車
ssh-copy-id -i /root/.ssh/id_rsa -p 22 root@hadoop1
輸入密碼，如果按我的來得話就是qwe123
ssh-copy-id -i /root/.ssh/id_rsa -p 22 root@hadoop2
輸入密碼，如果按我的來得話就是qwe123
ssh-copy-id -i /root/.ssh/id_rsa -p 22 root@hadoop3
輸入密碼，如果按我的來得話就是qwe123

1.4.3 測試是否配置成功

ping hadoop1 
ping hadoop2
ping hadoop3
ssh hadoop1
ssh hadoop2
ssh hadoop3

1.5 安裝配置hadoop

1.5.1 在hadoop1上操作

進入hadoop1
```
docker exec -it hadoop1 bash
```

建立一些資料夾，一會在配置中要用到

mkdir /home/hadoop
mkdir /home/hadoop/tmp /home/hadoop/hdfs_name /home/hadoop/hdfs_data

切換到hadoop配置的目錄
```
cd $HADOOP_HOME/etc/hadoop/
```

編輯core-site.xml

	<property>
        <name>fs.defaultFS</name>
        <value>hdfs://hadoop1:9000</value>
    </property>
    <property>
        <name>hadoop.tmp.dir</name>
        <value>file:/home/hadoop/tmp</value>
    </property>
    <property>
        <name>io.file.buffer.size</name>
        <value>131702</value>
    </property>

編輯hdfs-site.xml

 <property>
        <name>dfs.namenode.name.dir</name>
        <value>file:/home/hadoop/hdfs_name</value>
    </property>
    <property>
        <name>dfs.datanode.data.dir</name>
        <value>file:/home/hadoop/hdfs_data</value>
    </property>
    <property>
        <name>dfs.replication</name>
        <value>2</value>
    </property>
    <property>
        <name>dfs.namenode.secondary.http-address</name>
        <value>hadoop1:9001</value>
    </property>
    <property>
        <name>dfs.webhdfs.enabled</name>
        <value>true</value>
    </property>

編輯mapred-site.xml

mapred-site.xml預設不存在，要執行cp mapred-site.xml.template mapred-site.xml

 <property>
        <name>mapreduce.framework.name</name>
        <value>yarn</value>
    </property>
    <property>
        <name>mapreduce.jobhistory.address</name>
        <value>hadoop1:10020</value>
    </property>
    <property>
        <name>mapreduce.jobhistory.webapp.address</name>
        <value>hadoop1:19888</value>
    </property>

編輯yarn-site.xml

 <property>
        <name>yarn.nodemanager.aux-services</name>
        <value>mapreduce_shuffle</value>
    </property>
    <property>
        <name>yarn.nodemanager.auxservices.mapreduce.shuffle.class</name>
        <value>org.apache.hadoop.mapred.ShuffleHandler</value>
    </property>
    <property>
        <name>yarn.resourcemanager.address</name>
        <value>hadoop1:8032</value>
    </property>
    <property>
        <name>yarn.resourcemanager.scheduler.address</name>
        <value>hadoop1:8030</value>
    </property>
    <property>
        <name>yarn.resourcemanager.resource-tracker.address</name>
        <value>hadoop1:8031</value>
    </property>
    <property>
        <name>yarn.resourcemanager.admin.address</name>
        <value>hadoop1:8033</value>
    </property>
    <property>
        <name>yarn.resourcemanager.webapp.address</name>
        <value>hadoop1:8088</value>
    </property>

編輯slaves

我這裡把hadoop1當成主節點，hadoop2、3作為從節點
```
hadoop2
hadoop3
```

把檔案拷貝到hadoop2和hadoop3上

依次執行以下命令：

scp -r $HADOOP_HOME/ hadoop2:/usr/local/
scp -r $HADOOP_HOME/ hadoop3:/usr/local/

scp -r /home/hadoop hadoop2:/
scp -r /home/hadoop hadoop3:/

1.5.2 在每臺機器上操作

分別連線每臺機器

docker exec -it hadoop1 bash
docker exec -it hadoop2 bash
docker exec -it hadoop3 bash

配置hadoop sbin目錄的環境變數

因為hadoop bin目錄在之前建立映象時就配好了，但是sbin目錄沒有配，所以要單獨配置。分配為每臺機器配置：

vi ~/.bashrc

追加如下內容：

export PATH=$PATH:$HADOOP_HOME/sbin

執行：

source ~/.bashrc

1.5.3 啟動hadoop

在hadoop1上執行以下命令：

格式化hdfs
```
hdfs namenode -format
```
一鍵啟動
```
start-all.sh
```

不出錯的話，就可以慶祝一下了。出錯的話，加油。

1.6 測試使用hadoop

# hadoop1
1748 Jps
490 NameNode
846 ResourceManager
686 SecondaryNameNode

# hadoop2
400 DataNode
721 Jps
509 NodeManager

# hadoop3
425 NodeManager
316 DataNode
591 Jps

上傳檔案

hdfs dfs -mkdir /mwf

echo hello > a.txt
hdfs dfs -put a.txt /mwf

hdfs dfs -ls /mwf

Found 1 items
drwxr-xr-x   - root supergroup          0 2020-09-04 11:14 /mwf

由於是雲伺服器，不想配埠，就不看ui介面了。

2. 最後

以上是我安裝成功之後總結的過程，應該沒有問題，也可能有遺漏。

大家安裝過程中遇到什麼問題歡迎交流。有寫錯的地方也歡迎指正。

3. 參考

https://cloud.tencent.com/developer/article/1084166

https://cloud.tencent.com/developer/article/1084157?from=10680

https://blog.csdn.net/ifenggege/article/details/108396249

五行命令使用docker搭建hadoop叢集
2018-10-26
DockerHadoop
docker部署mysql叢集
2021-07-30
DockerMySql
Docker部署ElasticSearch叢集
2021-01-18
DockerElasticsearch
Linux部署hadoop2.7.7叢集
2022-08-15
LinuxHadoop
RabbitMQ系列（五）使用Docker部署RabbitMQ叢集
2018-07-24
MQDocker
Hadoop的叢集環境部署說明
2018-10-12
Hadoop
使用 docker-compose 部署 zookeeper（單機和叢集）
2024-06-02
Docker
Hadoop HA叢集與開發環境部署
2021-11-17
Hadoop開發環境
docker 下部署mongodb Replica Set 叢集
2018-05-09
DockerMongoDB
TDengine 叢集多機器docker 部署
2024-04-28
Docker
Hadoop搭建叢集
2018-06-26
Hadoop
Hadoop叢集搭建
2023-02-21
Hadoop
開源大資料叢集部署（十一）Ranger 整合Hadoop叢集
2024-02-28
大資料RangerHadoop
使用Docker Swarm快速搭建與部署你的服務叢集
2019-01-21
DockerSwarm
使用docker 搭建rabbitmq 叢集
2019-04-19
DockerMQ
docker初體驗：docker部署nginx負載均衡叢集
2021-08-30
DockerNginx負載
使用 Docker Compose 本地部署基於 Sentinel 的高可用 Redis 叢集
2018-03-04
DockerRedis
4.4 Hadoop叢集搭建
2018-11-15
Hadoop
Hadoop叢集搭建（一）
2020-10-02
Hadoop
redis Cluster模式叢集多機器 docker 部署
2024-04-28
Redis模式Docker
使用 Ansible 快速部署 HBase 叢集
2022-04-30
Elasticsearch使用系列-Docker搭建Elasticsearch叢集
2022-02-16
ElasticsearchDocker
Hadoop叢集面試題
2021-12-23
Hadoop面試題
Hadoop-叢集執行
2022-04-04
Hadoop
hadoop分散式叢集搭建
2021-03-04
Hadoop分散式
雲主機centos7搭建基於docker的hadoop叢集
2019-03-14
CentOSDockerHadoop
部署分片叢集
2024-07-08
Docker部署系列之Docker Compose安裝Redis三主三從叢集
2023-12-30
DockerRedis
使用docker-compose構建elasticsearch叢集
2018-09-21
DockerElasticsearch
053.叢集管理-Helm部署及使用
2020-05-12
Hadoop分散式叢集搭建_1
2018-05-17
Hadoop分散式
hadoop叢集配置和啟動
2024-05-11
Hadoop
Hadoop叢集常用命令
2019-02-20
Hadoop
Hadoop完全分散式叢集配置
2021-05-01
Hadoop分散式
Hadoop HA叢集簡單搭建
2020-12-26
Hadoop
Clickhouse Docker叢集部署
2021-08-16
Docker
安裝 Hadoop：設定單節點 Hadoop 叢集
2021-12-29
Hadoop
Docker Swarm叢集初探
2019-03-01
DockerSwarm