学习一：hadoop 1.0.1集群安装-低调大师

学习一：hadoop 1.0.1集群安装

2017-12-16 630

用vmware搭建三台Linux虚拟机，具体步骤如下：

1、hadoop下载地址：http://www.apache.org/dyn/closer.cgi/hadoop/core/

2、下载java6软件包，分别在三台安装

3、三台虚拟机，一台作为master，另外两台作为slave，分别配置/etc/hosts

    172.16.130.136   masternode
    172.16.130.137 slavenode1
    172.16.130.138 slavenode2

4、在三台主机/etc/profile设置环境变量

export JAVA_HOME=/usr/java/jdk1.6.0_13
export CLASSPATH=$CLASSPATH:$JAVA_HOME/lib:$JAVA_HOME/jre/lib
export HADOOP_HOME=/home/hduser/hadoop
export PATH=$JAVA_HOME/bin:$HADOOP_HOME/bin:$PATH

5、在三台机器上建立hadoop用户和组
    groupadd hadoop
    useradd -g hadoop hduser

6、在masternode节点创建SSH安全认证
$ ssh-keygen -t rsa -P ""
$cd .ssh
$ cat id_rsa.pub>>authorized_keys
$ssh masternode
$ssh slavenode1
$ssh slavenode2
将授权的文件分别拷贝到slavenode1和slavenode2，检查ssh登陆主机是否需要密码。

7、上传hadoop软件包到hadoop用户目录下解压
tar xvf hadoop*.gz

8、添加$HADOOP_HOME/conf/hadoop-env.sh
   export JAVA_HOME=/usr/java/jdk1.6.0_13

9、编辑$HADOOP_HOME/conf/core-site.xml
<configuration>
<property>
   <name>hadoop.tmp.dir</name>
   <value>/home/hduser/hadoop/tmp</value>
   <description>.</description>
</property>
<property>
   <name>fs.default.name</name>
   <value>hdfs://masternode:54310</value>
   <description> </description>
</property>
</configuration>

10、编辑$HADOOP_HOME/conf/mapred-site.xml
<configuration>
<property>
<name>mapred.job.tracker</name>
<value>masternode:54311</value>
<description>. </description>
</property>
</configuration>

11、编辑$HADOOP_HOME/conf/hdfs-site.xml
<configuration>
<property>
<name>dfs.replication</name>
<value>3</value>
<description>. </description>
</property>
</configuration>

12、编辑$HADOOP_HOME/conf/masters
masternode

13、编辑$HADOOP_HOME/conf/slaves
slavenode1
slavenode2

14、在所有机器上创建/home/hduser/hadoop/tmp

15、拷贝masternode上$HADOOP_HOME文件拷贝到各个节点上

16、在masternode进行格式化
hadoop -namenode -format

17、启动
start-all.sh
jps命令查看

18、访问masternode http://172.16.130.136:50030

访问slavenode http://172.16.130.137:50060

本文转自博客园知识天地的博客，原文链接：学习一：hadoop 1.0.1集群安装，如需转载请自行联系原博主。

微信关注我们

原文链接：https://yq.aliyun.com/articles/373593

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

Hadoop分布式文件系统：架构和设计

引言前提和设计目标硬件错误流式数据访问大规模数据集简单的一致性模型 “移动计算比移动数据更划算” 异构软硬件平台间的可移植性 Namenode 和 Datanode 文件系统的名字空间 (namespace) 数据复制副本存放: 最最开始的一步副本选择安全模式文件系统元数据的持久化通讯协议健壮性磁盘数据错误，心跳检测和重新复制集群均衡数据完整性元数据磁盘错误快照数据组织数据块 Staging 流水线复制可访问性 DFSShell DFSAdmin 浏览器接口存储空间回收文件的删除和恢复减少副本系数参考资料引言 Hadoop分布式文件系统(HDFS)被设计成适合运行在通用硬件(commodity hardware)上的分布式文件系统。它和现有的分布式文件系统有很多共同点。但同时，它和其他的分布式文件系统的区别也是很明显的。HDFS是一个高度容错性的系统，适合部署在廉价的机器上。HDFS能提供高吞吐量的数据访问，非常适合大规模数据集上的应用。HDFS放宽了一部分POSIX约束，来实现流式读取文件系统数据的目的。HDFS在最开始是作为Apach...

2017-12-16

645

1、概述小文件是指文件size小于HDFS上block大小的文件。这样的文件会给hadoop的扩展性和性能带来严重问题。首先，在HDFS中，任何block，文件或者目录在内存中均以对象的形式存储，每个对象约占150byte，如果有1000 0000个小文件，每个文件占用一个block，则namenode大约需要2G空间。如果存储1亿个文件，则namenode需要20G空间（见参考资料[1][4][5]）。这样namenode内存容量严重制约了集群的扩展。其次，访问大量小文件速度远远小于访问几个大文件。HDFS最初是为流式访问大文件开发的，如果访问大量小文件，需要不断的从一个datanode跳到另一个datanode，严重影响性能。最后，处理大量小文件速度远远小于处理同等大小的大文件的速度。每一个小文件要占用一个slot，而task启动将耗费大量时间甚至大部分时间都耗费在启动task和释放task上。本文首先介绍了hadoop自带的解决小文件问题的方案（以工具的形式提供），包括Hadoop Archive，Sequence file和CombineFileInputFormat；...

2017-12-16

593

资源下载

更多资源

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长，特征是大鼻子、头戴帽子、身穿背带裤，还留着胡子。与他的双胞胎兄弟路易基一起，长年担任任天堂的招牌角色。

Spring

Spring框架（Spring Framework）是由Rod Johnson于2002年提出的开源Java企业级应用框架，旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念，提供核心容器、应用上下文、数据访问集成等模块，支持整合Hibernate、Struts等第三方框架，其适用范围不仅限于服务器端开发，绝大多数Java应用均可从中受益。

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能，例如代码缩略图，Python的插件，代码段等。还可自定义键绑定，菜单和工具栏。Sublime Text 的主要功能包括：拼写检查，书签，完整的 Python API ， Goto 功能，即时项目切换，多选择，多窗口等等。Sublime Text 是一个跨平台的编辑器，同时支持Windows、Linux、Mac OS X等操作系统。

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源，继承了IntelliJ IDEA强大的JS部分的功能。