剖析管理所有大数据组件的可视化利器：Hue-低调大师

剖析管理所有大数据组件的可视化利器：Hue

2018-03-03 613

欢迎关注大数据和人工智能技术文章发布的微信公众号：清研学堂，在这里你可以学到夜白（作者笔名）精心整理的笔记，让我们每天进步一点点，让优秀成为一种习惯！

日常的大数据使用都是在服务器命令行中进行的，可视化功能仅仅依靠各个组件自带的web界面来实现，不同组件对应不同的端口号，如：HDFS(50070)，Yarn(8088),Hbase(16010)等等，而大数据的组件又有很多，为了解决某个问题，常常需要结合多个组件来使用，但是每个组件又有独立的web界面进行可视化，这时，如果有一个统一的web界面来管理并可以开发所有大数据的组件是非常方便的，而Hue正是这样的工具，它管理的大数据组件包括：HDFS、HBase、Hive、Pig、Sqoop、Spark、Scala等等几乎所有常用的组件。

（一）、HUE的介绍：

HUE是一个开源的Apache hadoop UI系统，管理hadoop生态体系结构的所有组件，基于python web框架Django实现，由Cloudera开发

HUE的tar包是源码包，采用源码安装（源码安装的好处：卸载和移植软件方便）

源码安装三步骤：

1、配置：./configure --preifix=安装的目录 #检测系统配置，生成makefile文件如果有makefile文件，直接进行编译和安装

2、编译：make

3、安装：make install

HUE的http服务端口：8888

二、安装和配置HUE：

安装HUE前，需要安装它所需要的rpm包及其依赖(27个)，否则HUE运行会报错 rpm包：redhat软件包管理器存放在redhat光盘Packages目录下

rpm包与tar.gz/.tgz、.bz2的区别：

rpm形式的软件包安装、升级、卸载方便，推荐初学者使用rpm形式的软件包

安装：rpm -ivh

卸载：rpm -e

tar.gz形式的软件包安装方便，卸载麻烦，用tar工具打包、gzip/bzip2压缩，安装时直接调用gzip/bzip2解压即可。如果解压后只有单一目录

用rm -rf命令删除，如果解压后分散在多个目录，必须手动一一删除

安装：tar -zxvf *.tar.gz/ tar -yxvf *.bz2

卸载：rm -rf/手动删除

一、安装rpm包：

方法：使用yum安装rpm包

yum：能够从指定的资源库(repository)自动下载、安装、升级rpm包及其依赖，必须要有可靠的资源库(repository)

1、挂载光盘 mount /dev/cdrom /mnt

mount命令：挂载硬盘/光盘/iso文件到指定目录下，访问其中的数据

2、建立yum资源库

cd /etc/yum.repos.d #yum资源库默认所在的目录

vim redhat7.repo

[redhat-yum] 资源库的标识

name=redhat7 资源库的名字

baseurl=file:///mnt 资源库的位置

enabled=1 启用资源库

gpgcheck=0 不检查资源库中的rpm包是否是官方的

3、执行下面的语句：

yum install gcc g++ libxml2-devel libxslt-devel cyrus-sasl-devel cyrus-sasl-gssapi mysql-devel python-devel python-setuptools sqlite-devel ant ibsasl2-dev libsasl2-modules-gssapi-mit libkrb5-dev libtidy-0.99-0 mvn openldap-dev libffi-devel gmp-devel openldap-devel

（二）、安装HUE：

解压：tar -zxvf hue-4.0.1.tgz

指定安装目录安装：PREFIX=/root/training make install

注：如果不指定prefix,可执行文件默认安装到/usr/local/bin中，配置文件默认安装到/usr/local/etc中，库文件默认安装到/usr/local/lib中，其他文件默认安装到/usr/local/share中

注：HUE的tar包是源码包，采用源码安装

三、配置HUE：

1、与hadoop集成：1、开启hdfs的web功能 2、允许HUE操作hdfs

<name>dfs.webhdfs.enabled</name>

</property>

<name>hadoop.proxyuser.root.hosts</name>

</property>

<name>hadoop.proxyuser.root.groups</name>

</property>

3、添加一个新用户并授权：hue要对/root/training/hue有访问权限

adduser hue

chown -R hue.hue /root/training/hue

4、修改配置文件hue.ini（$HUE_HOME/desktop/conf）:

http_hosts 192.168.182.11

http_port 192.168.182.11

server_user root

server_group root

default_user root

default_hdfs_superuser root

fs_defaulfs hdfs://192.168.182.11:9000

webhdfs_url http://192.168.182.11:50070/webhdfs/v1

hadoop_conf_dir /root/training/hadoop-2.7.3/etc/hadoop

resourcemanager_host 192.168.182.11

resourcemanager_api_url http://192.168.182.11:8088

proxy_api_url http://192.168.182.11:8088

history_server_api_url http://192.168.182.11:19888

二、与HBase集成:

1、修改配置文件hue.ini:

hbase_clusters=(Cluster|192.168.182.11:9090)

hbase_conf_dir=/root/training/hbase-1.3.1/conf

三、与Hive集成：

hive_server_host=192.168.182.11

hive_server_port=10000

hive_conf_dir=/root/training/apache-hive-2.3.0-bin/conf

（三）、启动HUE：

1、启动hadoop:start-all.sh hue就可以访问hadoop

2、启动hbase:start-hbase.sh

3、启动hbase的thrift server:hbase-daemon.sh start thrift hue就可以访问hbase

4、启动hive的元信息存储：hive --service metastore（表示前台运行） hue就可以访问hive的元信息

5、启动hive的thrift server:hiveserver2 &（表示后台运行） hue就可以访问hive

6、启动hue：bin/supervisor($HUE_HOME/build/env)

作者：李金泽，清华大学在读硕士，研究方向：大数据和人工智能

微信关注我们

原文链接：https://yq.aliyun.com/articles/606800

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

附录E Hadoop的word count例子

版权声明：本文为博主原创文章，未经博主允许不得转载。 https://blog.csdn.net/beliefer/article/details/77450068 注：本文是为了配合《Spark内核设计的艺术——架构设计与实现》一书的内容而编写，目的是为了节省成本、方便读者查阅。书中附录E的内容都在本文呈现。这里主要演示Hadoop1.0版本中的word count例子，用于和Spark中的实现对比。 package org.apache.hadoop.examples; import java.io.IOException; import java.util.Iterator; import java.util.StringTokenizer; import org.apache.hadoop.fs.Path; import org.apache.hadoop.io.IntWritable; import org.apache.hadoop.io.LongWritable; import org.apache.hadoop.io.Text; import org.apache.h...

2018-03-03

606

欢迎关注大数据和人工智能技术文章发布的微信公众号：清研学堂，在这里你可以学到夜白（作者笔名）精心整理的笔记，让我们每天进步一点点，让优秀成为一种习惯！一、spark SQL:类似于Hive，是一种数据分析引擎什么是spark SQL？ spark SQL只能处理结构化数据底层依赖RDD，把sql语句转换成一个个RDD，运行在不同的worker上特点： 1、容易集成：SQL语句 2、对不同的数据源提供统一的访问方式：DataFrame 用DataFrame屏蔽数据源的差别 3、兼容Hive 大纲：核心概念：DataFrame（看作表）：就是表，是Spark SQL对结构化数据的抽象集合表现形式：RDD 表=表结构+数据 DataFrame=schema+RDD DataSet(新API接口看作表) 如何创建DataFrame？ 1、方式一：通过case class创建DataFrame 创建表结构 case class EMP(empno:Int,ename:String,job:String,mgr:String,hiredata:String,sal:Int,comm...

2018-03-03

835

资源下载

更多资源

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长，特征是大鼻子、头戴帽子、身穿背带裤，还留着胡子。与他的双胞胎兄弟路易基一起，长年担任任天堂的招牌角色。

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题，腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构，目前腾讯云软件源站支持公网访问和内网访问。

Rocky Linux

Rocky Linux（中文名：洛基）是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版，作为CentOS稳定版停止维护后与RHEL（Red Hat Enterprise Linux）完全兼容的开源替代方案，由社区拥有并管理，支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性，采用模块化包装和SELinux安全架构，默认包含GNOME桌面环境及XFS文件系统，支持十年生命周期更新。

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源，继承了IntelliJ IDEA强大的JS部分的功能。