大数据集群搭建基础:Hadoop完全分布式搭建学习指南!!

Hadoop完全分布式搭建学习指南

Hadoop版本:Hadoop2.X
JDK版本:JDK1.8

一、准备工作

  1. 设置主机名和IP

    在三台CentOS 7.4机器上分别设置主机名和IP:

    • node1: 192.168.14.10
    • node2: 192.168.14.20
    • node3: 192.168.14.30

    修改主机名(以node1为例):

    hostnamectl set-hostname node1
    

    配置网络(依据具体网络环境和系统不同,配置方法可能有所不同)。

  2. 配置hosts文件

    在三台机器上的/etc/hosts文件中都添加以下内容,以便机器之间能通过主机名互相访问:

    192.168.14.10 node1
    192.168.14.20 node2
    192.168.14.30 node3
    
  3. 关闭防火墙和SELinux

    systemctl stop firewalld
    systemctl disable firewalld
    setenforce 0
    
  4. 配置SSH免密登录

    在node1上生成SSH密钥对,并将公钥分发到其他两个节点,实现免密登录(node2和node3上也需进行类似操作,以便日后维护)。

    ssh-keygen
    ssh-copy-id node1
    ssh-copy-id node2
    ssh-copy-id node3
    

二、安装Java环境

  1. 下载并解压JDK

    下载JDK压缩包到/opt,然后解压。

    cd /opt
    tar -zxvf jdk-xxx-linux-x64.tar.gz
    
  2. 配置环境变量

    编辑/etc/profile,添加以下内容:

    export JAVA_HOME=/opt/jdk1.8.0_xxx
    export PATH=$PATH:$JAVA_HOME/bin
    

    使环境变量生效:

    source /etc/profile
    

三、安装Hadoop

  1. 下载并解压Hadoop

    从Apache官网下载Hadoop压缩包到/opt,然后解压。

    cd /opt
    tar -zxvf hadoop-x.x.x.tar.gz
    
  2. 配置Hadoop环境变量

    编辑/etc/profile,添加:

    export HADOOP_HOME=/opt/hadoop-x.x.x
    export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
    

    使环境变量生效:

    source /etc/profile
    
  3. 配置Hadoop

    需要配置的文件主要有hadoop-env.shcore-site.xmlhdfs-site.xmlyarn-site.xmlmapred-site.xmlslaves

    • hadoop-env.sh:设置Java环境。

      export JAVA_HOME=/opt/jdk1.8.0_xxx
      
    • core-site.xml:配置HDFS的地址。

      <configuration><property><name>fs.defaultFS</name><value>hdfs://node1:9000</value></property><property><name>hadoop.tmp.dir</name><value>/opt/hadoop-x.x.x/tmp</value></property>
      </configuration>
      
    • hdfs-site.xml:配置HDFS的副本数等参数。

      <configuration><property><name>dfs.replication</name><value>2</value></property><property><name>dfs.namenode.name.dir</name><value>/opt/hadoop-x.x.x/hdfs/namenode</value></property><property><name>dfs.datanode.data.dir</name><value>/opt/hadoop-x.x.x/hdfs/datanode</value></property>
      </configuration>
      
      • yarn-site.xml:配置YARN的资源管理器等参数。

        <configuration><property><name>yarn.resourcemanager.hostname</name><value>node1</value></property><property><name>yarn.nodemanager.aux-services</name><value>mapreduce_shuffle</value></property>
        </configuration>
      • mapred-site.xml(如果不存在,可复制mapred-site.xml.template并重命名为mapred-site.xml):配置MapReduce的运行框架为YARN。

        <configuration><property><name>mapreduce.framework.name</name><value>yarn</value></property>
        </configuration>
        
      • slaves:配置DataNode所在的节点。

        node1
        node2
        node3
        
  4. 分发Hadoop到其他节点

    使用scp命令将配置好的Hadoop目录分发到其他两个节点。

    scp -r /opt/hadoop-x.x.x node2:/opt/
    scp -r /opt/hadoop-x.x.x node3:/opt/
    
  5. 格式化HDFS

    在node1上执行以下命令来格式化HDFS。

    hdfs namenode -format
    
  6. 启动Hadoop

    在node1上启动Hadoop集群。

    start-dfs.sh
    start-yarn.sh
    
  7. 验证Hadoop是否启动成功

    通过Web界面访问http://node1:50070/来查看HDFS的状态,访问http://node1:8088/来查看YARN的状态。同时,也可以通过jps命令在各个节点上查看运行的Hadoop进程。

以下是将Hadoop完全分布式配置下各节点的进程以表格形式展现的示例:

节点进程
node1NameNode
SecondaryNameNode
ResourceManager
DataNode
NodeManager
node2DataNode
NodeManager
node3DataNode
NodeManager

各文件详细配置内容

core-site.xml

<configuration><!-- 指定Hadoop集群中的默认文件系统为HDFS --><property><name>fs.defaultFS</name><value>hdfs://node1:9000</value></property><!-- 配置Hadoop临时目录,用于存放MapReduce作业执行过程中的中间数据 --><property><name>hadoop.tmp.dir</name><value>/opt/hadoop-x.x.x/tmp</value></property>
</configuration>

hdfs-site.xml

<configuration><!-- 指定NameNode的存储路径,即NameNode元数据的存放位置 --><property><name>dfs.namenode.name.dir</name><value>/opt/hadoop-x.x.x/hdfs/namenode</value></property><!-- 指定DataNode的存储路径,即实际数据存储的位置 --><property><name>dfs.datanode.data.dir</name><value>/opt/hadoop-x.x.x/hdfs/datanode</value></property><!-- 配置HDFS的副本数,即每个数据块会被复制多少份,通常设置为3 --><property><name>dfs.replication</name><value>3</value></property>
</configuration>

yarn-site.xml

<configuration><!-- 指定ResourceManager的地址,YARN作业提交到这里进行资源分配和调度 --><property><name>yarn.resourcemanager.hostname</name><value>node1</value></property><!-- 配置NodeManager提供的辅助服务,mapreduce_shuffle是MapReduce作业必须的服务 --><property><name>yarn.nodemanager.aux-services</name><value>mapreduce_shuffle</value></property><!-- (可选)配置ResourceManager的Web界面地址和端口 --><property><name>yarn.resourcemanager.webapp.address</name><value>node1:8088</value></property>
</configuration>

mapred-site.xml

<configuration><!-- 指定MapReduce作业的运行框架为YARN --><property><name>mapreduce.framework.name</name><value>yarn</value></property>
</configuration>

slaves

# 指定DataNode所在的节点,每行一个节点名
node1 //结点1
node2 //结点2
node3 //结点3

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/diannao/30708.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

从 0 打造私有知识库 RAG Benchmark 完整实践

背景介绍 最近从 0 构建了一个大模型知识库 RAG 服务的自动化 Benchmark 评估服务&#xff0c;可以基于私有知识库对 RAG 服务进行批量自动化测试与评估。本文是对这个过程的详细记录。 本文实际构建的是医疗行业知识库&#xff0c;基于高质量的医学指南和专家共识进行构建。…

前端从视频文件提取画面帧

extractFramesFromVideo方法提取画面帧 // 设定一个异步函数&#xff0c;输入参数为&#xff1a; // videoUrl&#xff08;需要提取画面帧的视频的URL&#xff09; // fps&#xff08;每秒帧率&#xff0c;默认为25帧&#xff09; async function extractFramesFromVideo(vide…

Linux中MySQL的相关配置及命令(Ubuntu22.04)

安装 MySQL apt install mysql-server apt install mysql-client相关配置文件 默认配置文件地址: /etc/mysql/mysql.conf.d 基础配置如下 # 基础配置 [mysqld] # # * Basic Settings # user mysql pid-file /var/run/mysqld/mysqld.pid socket /var/run/mysqld/mysqld.…

uni-app地图组件控制

uni.createMapContext(mapId,this) 创建并返回 map 上下文 mapContext 对象。在自定义组件下&#xff0c;第二个参数传入组件实例this&#xff0c;以操作组件内 <map> 组件。 注意&#xff1a;uni.createMapContext(mapId, this) app-nvue 平台 2.2.5 支持 uni.create…

DataWorks Copilot:大模型时代数据开发的新范式

导读 DataWorks 是阿里云一站式智能化数据开发与治理平台&#xff0c;支持搭配MaxCompute/Hologres/AnalyticDB/StarRocks/EMR/CDH 等大数据引擎&#xff0c;为企业构建数据仓库、数据湖以及湖仓一体&#xff08;Lakehouse&#xff09;现代数据架构提供数据平台产品解决方案。…

推荐一款功能强大的显示器!

最近在写项目开发文档&#xff0c;经常需要几个界面来回切换&#xff0c;真的深刻感受到了一台外接显示器对一名程序员来说有多重要了&#xff0c;画功能流程图的时候嫌弃自己的笔记本屏幕不够大&#xff0c;看代码的时候又在想要是有个旋转屏就好了&#xff0c;来回切换界面的…

C实时导航

导航算法怎么改成实时的&#xff1f; 将导航算法改为实时运行需要考虑几个关键因素&#xff0c;包括数据源的实时性、算法的计算效率、以及与外部硬件&#xff08;如传感器、执行器等&#xff09;的实时交互。由于MATLAB不是用于实时系统的首选工具&#xff08;尽管它有一些实时…

【JavaScript复习二】选择结构if和Switch(1)

### []( )2、单分支条件分支语句if (条件表达式) { // 条件为真时&#xff0c;做的事情 } else { // 条件为假时&#xff0c;做的事情 } ### []( )2,、多分支的 if 语句if (条件表达式1) { // 条件1为真时&#xff0c;做的事情} else if (条件表达式2) { // 条件1不满足&…

使用Selenium进行Web自动化:详细操作指南

使用Selenium进行Web自动化:详细操作指南 引言 Selenium是一个广泛使用的开源工具,用于自动化Web浏览器的操作。无论你是进行自动化测试,还是需要抓取网页数据,Selenium都是一个非常有用的工具。本文将详细介绍Selenium的一些常见用法,包括输入框设置值、文件上传、单选…

java基础·小白入门(四)

目录 异常处理基本概念处理过程 Java泛型与容器类泛型容器类 异常处理 基本概念 异常&#xff08;exception&#xff09;&#xff1a;是指在硬件和操作系统正常时&#xff0c;程序遇到的运行错误。如数组下标越界、除数为0、用户输入非法、打开一个不存在的文件、网络连接中断…

Java中的数据结构与算法优化攻略

Java中的数据结构与算法优化攻略 大家好&#xff0c;我是免费搭建查券返利机器人省钱赚佣金就用微赚淘客系统3.0的小编&#xff0c;也是冬天不穿秋裤&#xff0c;天冷也要风度的程序猿&#xff01; 在Java应用开发中&#xff0c;数据结构与算法的选择和优化对于提高程序的性能…

【杂记-浅谈Time To Live/TTL】

文章目录 一、TTL概述二、TTL在IP数据包中的应用三、TTL在DNS系统中的应用四、TTL的其他应用 一、TTL概述 Time To Live&#xff0c;TTL&#xff0c;主要有两个含义&#xff1a;一个是作为IP数据包中的一个字段&#xff0c;另一个是与DNS记录相关的存活时间。 1、在IP数据包中…

java分别使用 iText 7 库和iText 5 库 将excel转成PDF导出,以及如何对excel转PDF合并单元格

第一种 package com.junfun.pms.report.util;import com.itextpdf.kernel.font.PdfFontFactory; import com.itextpdf.layout.Document; import com.itextpdf.layout.element.Paragraph; import com.itextpdf.layout.property.TextAlignment; import com.itextpdf.layout.prop…

kafka学习笔记07

Kafka高可用集群搭建节点需求规划 开放端口。 Kafka高可用集群之zookeeper集群搭建环境准备 删除之前的kafka和zookeeper。 重新进行环境部署&#xff1a; 我们解压我们的zookeeper: 编辑第一个zookeeper的配置文件: 我们重复类似的操作&#xff0c;创建三个zookeeper节点: 记…

SM4 国密——加密,解密

SM4 国密的使用 前言——引用管理包SM4解密——ECB模式SM4加密——ECB模式SM4解密——CBC模式SM4加密——CBC模式SM4工具类SM4主体类SM4实体类 前言——引用管理包 引用NuGet管理包BouncyCastle.Crypto SM4解密——ECB模式 public string CiphertextParsing(string json) {tr…

【数学建模】解析几何与方程模型

文章目录 解析几何与方程模型1.几何建模思想2.Numpy在线性代数中的使用3.国赛求解3.1题目3.2 问题1求解建立模型代码求解 3.3 问题2求解 4.问题答疑Q1:什么是行列式&#xff0c;其使用场景是什么行列式的定义行列式的性质行列式的使用场景 Q2:2023B题问题一用相似三角形求解覆盖…

使用rkhunter Rootkit猎手检查Rootkit:全面指南

在网络安全领域&#xff0c;Rootkit是一种隐蔽性极强的恶意软件&#xff0c;它能够隐藏攻击者的痕迹和未授权访问路径。Linux系统因其开放性和复杂性&#xff0c;容易受到Rootkit的攻击。rkhunter&#xff0c;即Rootkit Hunter&#xff0c;是一款专门设计来检测Linux系统中Root…

centos查找文件 及 操作写入的进程

du -sh * 查看目录空间占用、发现大文件&#xff0c;确定进程&#xff0c;结束 yum install lsof 安装lsof 查看文件写入的 进程 2. lsof /root/.influxdbv2/engine/data/bab49411e5f7cbce/autogen/1/000000036-000000002.tsm COMMAND PID USER FD TYPE …

sql server 非sa账号配置发布订阅

如果有些源端环境&#xff0c;sa账号被禁用&#xff0c;或者有其他问题&#xff0c;那可以按以下步骤操作。 使用高权限账户登录&#xff0c;另外需要拥有源端windows用户管理员的账号和密码 表发布订阅成功的前提&#xff1a;发布的表必须有主键。 创建一个专门用于发布订阅的…

国际导师上海面授大规模敏捷LeSS认证2024年8月22-24日开班 | 报名享特大福利

课堂互动练习 学员反馈 • “LeSS课我正经听过的有3次&#xff1b;两次Bas Vodde主讲&#xff0c;一次吕毅老师主讲。第一次应该是2015年&#xff0c;这门课中体现的对组织运作和产品开发底层逻辑的洞见令我折服。后来又陆续听了两次&#xff0c;每次都有更多体会。 我试着从一…