百度360必应搜狗淘宝本站头条
当前位置:网站首页 > IT技术 > 正文

Hadoop集群部署之大数据平台组件配置——基于CM和CDH

wptr33 2024-12-20 19:03 24 浏览

CDH(Cloudera’s Distribution Including Apache Hadoop)是大数据平台Hadoop的Cloudera发行版。

Cloudera Manager(简称CM)是Cloudera公司开发的一款CDH大数据集群部署运维工具,具有集群自动化安装、中心化管理、集群监控、报警等功能,使得安装集群从几天的时间缩短在几小时以内,运维人员从数十人降低到几人以内,极大的提高集群管理的效率。

CM提供HDFS,YARN,MapReduce,HBase,Hive等组件,可满足大数据的存储和数据分析、数据仓库、数据挖掘的需要。本文介绍集群部署时CM组件的部署安装。

1 CM组件安装

集群规划


1.1 配置CM运行环境

选择CM 企业版试用版本

在群集安装时,选择方法-》更多选项,删除远程地址。



消除主机正确性检查的警告:

echo 10 > /proc/sys/vm/swappiness

echo never > /sys/kernel/mm/transparent_hugepage/defrag

echo never > /sys/kernel/mm/transparent_hugepage/enabled

1.2 增加report数据库

CDH运行时生成的报告需要使用的数据库。

create database report;

create user 'reportmanager'@'%' identified by 'reportmanager';

grant all on report.* TO 'reportmanager'@'%';

grant all on report.* TO 'reportmanager'@'localhost' identified by 'reportmanager';

1.3 安装HDFS

修改目录,将/etc修改为/home/cdh

注意:HDFS的节点路径不能有777权限,应使用755。



安装完成后进入主界面


1.4 增加HDFS的节点

需要先将主机加入集群。

群集-》HDFS-》实例-》添加角色实例。


自定义-》选择主机,按照向导逐步完成。



1.5 ZooKeeper

规划:3个节点的zk

集群-》操作-》添加服务,选择ZooKeeper。



主机选择01,02,03,部署3个节点的zk



按照向导,默认安装。



1.6 YARN

集群规划


修改目录,将/etc修改为/home/cdh,其他默认


1.7 HBase

集群规划


默认安装



1.8 Hive

集群规划



默认安装



1.9 Impala

集群规划



修改目录,将/etc修改为/home/cdh,其他默认




如果服务未启动,执行重启



1.10 Solr

默认安装Solr,需要HDFS,ZooKeeper支持



1.11 Flume

添加Flume服务,在指定主机(03)安装agent

安装完成后在03主机可以运行flume命令



1.12 Sqoop

添加Sqoop2服务,在指定主机(02)安装agent



安装完成后,在主机运行sqoop命令



sqoop import --connect jdbc:mysql://172.18.0.5:3306/test --username root --password root --table student -m 1



查看结果



1.13 Oozie

添加Oozie服务,在指定主机(01)安装




1.14 HUE


安装loadBalance依赖服务

yum install httpd -y

yum install mod_ssl –y

添加hue服务,在指定主机(01)安装Server,在01,03安装Load Balancer。




1.15 Spark

添加hue服务,在(01)安装Server,在01,02,03安装Gateway。



主机端可以进行spark交互



关于spark gateway不启动和不适用的说明

spark gateway标识的服务器具有spark-shell和spark-submit环境,没有服务,所以显示为灰色不适用。在节点中打开spark-shell正常使用就OK。



1.16 CM、HUE、Oozie时区统一

CM设置时区:CM服务器的时区设置

HUE设置时区:修改为 Asia/Shanghai


相关推荐

什么是Java中的继承?如何实现继承?

什么是继承?...

Java 继承与多态:从基础到实战的深度解析

在面向对象编程(OOP)的三大支柱中,继承与多态是构建灵活、可复用代码的核心。无论是日常开发还是框架设计,这两个概念都扮演着至关重要的角色。本文将从基础概念出发,结合实例与图解,带你彻底搞懂Java...

Java基础教程:Java继承概述_java的继承

继承概述假如我们要定义如下类:学生类,老师类和工人类,分析如下。学生类属性:姓名,年龄行为:吃饭,睡觉老师类属性:姓名,年龄,薪水行为:吃饭,睡觉,教书班主任属性:姓名,年龄,薪水行为:吃饭,睡觉,管...

java4个技巧:从继承和覆盖,到最终的类和方法

日复一日,我们编写的大多数Java只使用了该语言全套功能的一小部分。我们实例化的每个流以及我们在实例变量前面加上的每个@Autowired注解都足以完成我们的大部分目标。然而,有些时候,我们必须求助于...

java:举例说明继承的概念_java继承的理解

在现实生活中,继承一般指的是子女继承父辈的财产。在程序中,继承描述的是事物之间的所属关系,通过继承可以使多种事物之间形成一种关系体系。例如猫和狗都属于动物,程序中便可以描述为猫和狗继承自动物,同理,...

从零开始构建一款开源的 Vibe Coding 产品 Week1Day4:业界调研之 Agent 横向对比

前情回顾前面两天我们重点调研了了一下Cursor的原理和Cursor中一个关键的工具edit_file的实现,但是其他CodingAgent也需要稍微摸一下底,看看有没有优秀之处,下...

学会这几个插件,让你的Notepad++使用起来更丝滑

搞程序开发的小伙伴相信对Notepad++都不会陌生,是一个占用空间少、打开启动快的文件编辑器,很多程序员喜欢使用Notepad++进行纯文本编辑或者脚本开发,但是Notepad++的功能绝不止于此,...

将 node_modules 目录放入 Git 仓库的优点

推荐一篇文章Whyyoushouldcheck-inyournodedependencies[1]...

再度加码AI编程,腾讯发布AI CLI并宣布CodeBuddy IDE开启公测

“再熬一年,90%的程序员可能再也用不着写for循环。”凌晨两点半,王工还在公司敲键盘。他手里那份需求文档写了足足六页,产品经理反复改了三次。放在过去,光数据库建表、接口对接、单元测试就得写两三天。现...

git 如何查看stash的内容_git查看ssh key

1.查看Stash列表首先,使用gitstashlist查看所有已保存的stash:...

6万星+ Git命令懒人必备!lazygit 终端UI神器,效率翻倍超顺手!

项目概览lazygit是一个基于终端的Git命令可视化工具,通过简易的TUI(文本用户界面)提升Git操作效率。开发者无需记忆复杂命令,即可完成分支管理、提交、合并等操作。...

《Gemini CLI 实战系列》(一)Gemini CLI 入门:AI 上命令行的第一步

谷歌的Gemini模型最近热度很高,而它的...

deepin IDE新版发布:支持玲珑构建、增强AI智能化

IT之家8月7日消息,深度操作系统官方公众号昨日(8月6日)发布博文,更新推出新版deepin集成开发环境(IDE),重点支持玲珑构建。支持玲珑构建deepinIDE在本次重磅更...

狂揽82.7k的star,这款开源可视化神器,轻松创建流程图和图表

再不用Mermaid,你的技术文档可能已经在悄悄“腐烂”——图表版本对不上、同事改完没同步、评审会上被一句“这图哪来的”问得哑口无言。这不是危言耸听。GitHub2025年开发者报告显示,63%的新仓...

《Gemini CLI 实战系列》(五)打造专属命令行工具箱

在前几篇文章中,我们介绍了GeminiCLI的基础用法、效率提升、文件处理和与外部工具结合。今天我们进入第五篇...