新闻详情

新闻详情

首页 / 资讯中心 / 详情

Rocky Linux10.2 搭建 Hadoop‑3.3.5 + Spark‑3.5.0 完整环境搭建步骤

发布时间:2026/10/1 8:31:05来源:尧图网络
Rocky Linux10.2 搭建 Hadoop‑3.3.5 + Spark‑3.5.0 完整环境搭建步骤
环境VMware虚拟机 Rocky Linux10.2内存2.5G远程工具MobaXterm Personal 23.0全部操作使用root用户 注意每一步均为MobaXterm SSH终端执行vim编辑按i进入编辑改完按Esc输入:wq回车保存退出。前置准备VMware打开Rocky Linux10.2虚拟机开机。MobaXterm新建SSH会话Session → SSHRemote host填虚拟机IPusername填root输入密码登录。在MobaXterm终端输入查看本机IP记下IP后面配置hosts要用ip a找到ens160的inet地址示例192.168.137.129步骤1安装 OpenJDK21dnf install -y java-21-openjdk java-21-openjdk-devel验证安装java -version看到openjdk 21版本即成功。查看java真实安装路径update-alternatives --list java路径/usr/lib/jvm/java-21-openjdk配置系统环境变量vim /etc/profile文件最末尾添加export JAVA_HOME/usr/lib/jvm/java-21-openjdk export PATH$PATH:$JAVA_HOME/bin:wq保存。 生效环境变量source /etc/profile校验JAVA_HOMEecho $JAVA_HOME步骤2关闭防火墙与SELinuxsystemctl stop firewalld systemctl disable firewalld setenforce 0步骤3设置主机名、hosts映射设置主机名为masterhostnamectl set-hostname master修改hosts文件把下面IP替换成你ip a查到的虚拟机IPvim /etc/hosts文件末尾增加一行192.168.137.129 master:wq保存。步骤4配置SSH免密登录Hadoop启动依赖ssh-keygen -t rsa一路回车不要输入任何密码。cat ~/.ssh/id_rsa.pub ~/.ssh/authorized_keys chmod 600 ~/.ssh/authorized_keys测试免密登录ssh master不需要输入密码即为成功输入exit退回原终端。步骤5下载、解压Hadoop‑3.3.5进入/opt目录cd /opt下载安装包清华镜像速度快wget https://mirrors.tuna.tsinghua.edu.cn/apache/hadoop/common/hadoop-3.3.5/hadoop-3.3.5.tar.gz解压并重命名tar -zxvf hadoop-3.3.5.tar.gz mv hadoop-3.3.5 hadoop配置Hadoop环境变量vim /etc/profile文件末尾追加export HADOOP_HOME/opt/hadoop export PATH$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin:wq保存生效source /etc/profile验证hadoop版本hadoop version步骤6修改Hadoop5个核心配置文件配置文件目录/opt/hadoop/etc/hadoop① hadoop‑env.shvim /opt/hadoop/etc/hadoop/hadoop-env.sh文件末尾粘贴export JAVA_HOME/usr/lib/jvm/java-21-openjdk export HDFS_NAMENODE_USERroot export HDFS_DATANODE_USERroot export HDFS_SECONDARYNAMENODE_USERroot export YARN_RESOURCEMANAGER_USERroot export YARN_NODEMANAGER_USERroot② core‑site.xmlvim /opt/hadoop/etc/hadoop/core-site.xmlconfiguration property namefs.defaultFS/name valuehdfs://master:9000/value /property property namehadoop.tmp.dir/name value/opt/hadoop/tmp/value /property /configuration③ hdfs‑site.xmlvim /opt/hadoop/etc/hadoop/hdfs-site.xmlconfiguration property namedfs.replication/name value1/value /property /configuration④ mapred‑site.xmlcp /opt/hadoop/etc/hadoop/mapred-site.xml.template /opt/hadoop/etc/hadoop/mapred-site.xmlvim /opt/hadoop/etc/hadoop/mapred-site.xmlconfiguration property namemapreduce.framework.name/name valueyarn/value /property /configuration⑤ yarn‑site.xml适配2.5G虚拟机内存vim /opt/hadoop/etc/hadoop/yarn-site.xmlconfiguration property nameyarn.nodemanager.aux-services/name valuemapreduce_shuffle/value /property property nameyarn.nodemanager.resource.memory-mb/name value1536/value /property property nameyarn.scheduler.maximum-allocation-mb/name value1280/value /property property nameyarn.scheduler.minimum-allocation-mb/name value256/value /property /configuration步骤7格式化HDFS 只执行一次禁止多次运行hdfs namenode -format看到successfully formatted表示格式化成功。步骤8启动Hadoop集群start-dfs.sh start-yarn.sh查看进程验证集群启动jps需要看到NameNode、DataNode、SecondaryNameNode、ResourceManager、NodeManager网页访问Windows浏览器 HDFS页面http://虚拟机IP:9870YARN页面http://虚拟机IP:8088如果进程缺失查看Hadoop日志命令tail -200 /opt/hadoop/logs/hadoop-root-namenode-master.log tail -200 /opt/hadoop/logs/hadoop-root-datanode-master.log步骤9安装Spark‑3.5.0支持JDK21cd /opt wget https://mirrors.tuna.tsinghua.edu.cn/apache/spark/spark-3.5.0/spark-3.5.0-bin-hadoop3.tgz tar -zxvf spark-3.5.0-bin-hadoop3.tgz mv spark-3.5.0-bin-hadoop3 spark配置Spark环境变量vim /etc/profile末尾增加export SPARK_HOME/opt/spark export PATH$PATH:$SPARK_HOME/bin:$SPARK_HOME/sbin:wq生效source /etc/profile修改spark配置文件cd /opt/spark/conf cp spark-env.sh.template spark-env.sh vim spark-env.sh末尾粘贴export JAVA_HOME/usr/lib/jvm/java-21-openjdk export HADOOP_CONF_DIR/opt/hadoop/etc/hadoop export YARN_CONF_DIR/opt/hadoop/etc/hadoop写入主机名cp workers.template workers ​​​​​​​vim workersmaster环境搭建完成校验jps查看Hadoop五个进程正常运行。输入命令检验spark版本spark-submit --version能输出版本号即为环境搭建全部完成。环境启停常用命令启动集群start-dfs.sh start-yarn.sh关闭集群stop-yarn.sh stop-dfs.sh查看进程jpsHadoop查看日志排查故障tail -200 /opt/hadoop/logs/hadoop-root-namenode-master.log tail -200 /opt/hadoop/logs/hadoop-root-datanode-master.log重要注意事项hdfs namenode -format只执行一次多次格式化会造成NameNode与DataNode的clusterID不一致DataNode无法启动。对于虚拟机内存比较小的yarn‑site.xml内存参数不要调大。hosts里面IP必须和ip a查到的ens33IP保持一致主机名固定为master。防火墙必须关闭否则Windows浏览器打不开9870、8088网页。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Linux脏页回写与Swap机制解析:内存性能优化实战指南 2026/10/1 9:28:28

Linux脏页回写与Swap机制解析:内存性能优化实战指南

1. 脏页从哪来:写操作背后的内存账本很长一段时间里,我在排查服务器性能问题时,总是先看 CPU、再看磁盘 IO,直到被一次“负载不高但写入极慢”的故障折磨了一整天才反应过来——真正拖慢系统的是内存里的脏页,而不是磁…

阅读更多 →
PyCharm中文指南:安装汉化、环境配置与远程开发全攻略 2026/10/1 9:28:28

PyCharm中文指南:安装汉化、环境配置与远程开发全攻略

简介:PyCharm 是 Python 开发中最常用的集成开发环境之一,这份中文手册系统梳理了 PyCharm 的核心使用技巧,由资深开发者基于大量实操经验撰写,面向初中级 Python 开发者及希望提升开发效率的编程人员,帮助读者快速掌握…

阅读更多 →
SQL核心操作手册:从增删改查到查询优化 2026/10/1 9:28:28

SQL核心操作手册:从增删改查到查询优化

数据库和SQL这两个词,听起来好像只有后端程序员才要碰,但你只要在任何一个网站、后台系统、甚至一个小工具箱项目里做过数据存取,就会明白它们才是真正的“地基”。数据库负责把数据规规矩矩地存下来,SQL则是你跟它对话的唯一通用…

阅读更多 →
手工实现TINY词法分析器:DFA状态机与最长匹配原理 2026/10/1 9:28:22

手工实现TINY词法分析器:DFA状态机与最长匹配原理

简介:本资源是面向编译原理初学者与高校课程实践者的TINY语言词法分析器完整实现工程,聚焦C/C手写DFA状态机的核心教学场景,解决词法分析阶段从理论到代码落地的关键难点。压缩包共10个文件,含3个TINY源程序(t1.tny–t…

阅读更多 →
医疗行业数据安全建设与合规如何做? 2026/10/1 9:28:22

医疗行业数据安全建设与合规如何做?

26年第30届中国医院信息网络大会(CHIMA 2026)在珠海盛大召开,本次大会汇聚了医疗信息化领域的前沿技术与创新实践成果。在网络与数据安全分会场上,中山大学附属第三医院(以下简称“中山三院”)银琳主任发表…

阅读更多 →
车规级驾驶员行为检测数据集:22600张YOLO格式实战基底 2026/10/1 9:28:15

车规级驾驶员行为检测数据集:22600张YOLO格式实战基底

1. 项目概述:这不是一个“拿来就能用”的数据集,而是一套经过实战打磨的驾驶员行为检测训练基底 你搜到这个标题——“驾驶员行为检测数据集 | 22600张YOLO智能驾驶数据集”——大概率正卡在三个关键节点上:要么刚接手车载ADAS功能开发&#…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉