hadoop1.2.1伪分布模式配置-低调大师

hadoop1.2.1伪分布模式配置

2013-10-20 710

1、修改core-site.xml，配置hdfs

 1 <configuration>
 2  <property>
 3   <name>fs.default.name</name>
 4   <value>hdfs://localhost:9000</value>
 5  </property>
 6  <property>
 7   <name>hadoop.tmp.dir</name>
 8   <value>/home/jimmy/Desktop/tmp</value>
 9  </property>
10 </configuration>

注：

a) fs.default.name对应的value是hdfs的ip和端口，只要端口不被占用即可
b) hadoop.tmp.dir对应的value是hadoop临时文件的保存目录(根据需要修改成实际目录)

2、修改hdfs-site.xml，配置数据备份

1 <configuration>
2     <property>
3         <name>dfs.replication</name>
4         <value>1</value>
5     </property>
6 </configuration>

注：这是配置写数据时，数据同时写几份（出于学习目的，这里只写一个副本，实际应用中，至少配置成3）

3、修改mapred-site.xml

1 <configuration>
2     <property>
3         <name>mapred.job.tracker</name>
4         <value>localhost:9001</value>
5     </property>
6 </configuration>

注：这是配置map/reduce服务器ip和端口

4、配置ssh

注：因为伪分布模式下，即使所有节点都在一台机器上，hadoop也需要通过ssh登录，这一步的目的是配置本机无密码ssh登录

命令行：ssh-keygen -t rsa

然后一路回车

cd ~/.ssh

cat id_rsa.pub>>authorized.keys

测试：ssh localhost

首次运行会提示是否继续，输入yes，回车，如果不要求输入密码，就表示成功了

5、首次运行，格式化hdfs

<HADOOP_HOME>/bin/hadoop namenode -format

6、启动单节点集群

<HADOOP_HOME>/bin/hadoop start-all.sh

如果没问题的话，命令行输入jps，可以看到5个进程:

jimmy@ubuntu:~/Desktop/soft/hadoop-1.2.1$ jps
13299 TaskTracker
13071 SecondaryNameNode
13363 Jps
13160 JobTracker
12786 NameNode
12926 DataNode

停止的话，类似的 bin/hadoop stop-all.sh

7、查看状态

http://localhost:50030/ 这是Hadoop管理界面

http://localhost:50060/ 这是Hadoop Task Tracker 状态

http://localhost:50070/ 这是Hadoop DFS 状态

8、伪分布模式下运行Hadoop自带的wordcount

注：以下命令的当前目录都是hadoop根目录

a) 先随便准备一个txt文件，比如hadoop下自带的README.txt

b) hdfs中创建一个输入目录input

bin/hadoop fs -mkdir input (注：hdfs中的命令跟linux终端中的文件操作命令基本类似，但是前面要加fs)

c) 将README.txt放到hdfs的input目录中

bin/hadoop fs -put ./README.txt input

这时，如果在浏览器里用http://localhost:50070/ 浏览hdfs文件列表的话，可以看到刚才放进去的文件

d)执行wordcount示例程序

bin/hadoop jar hadoop-examples-1.2.1.jar wordcount /user/jimmy/input/README.txt /user/jimmy/output (注：这里的jimmy为hadoop运行时的用户名，根据需要换成自己的实际用户名)

e)从hdfs中取回文件到本地

bin/hadoop fs -get /user/jimmy/output ~/Desktop/ (这样，就把运算结果output中的文件，取到本地桌面了)

微信关注我们

原文链接：https://yq.aliyun.com/articles/250961

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

ubuntu13.04环境hadoop1.2.1单机模式安装

一、虚拟机上安裝ubuntun 13.04 中文版当然，你要是习惯看英文版，也可以直接安装英文版。老老实实从官网下载安装即可，安装系统不是本文的重点。这里只提一个注意事项：新手安装前，切记断网，因为安装过程中会联网下载，默认情况下连接的是美国的服务器，如果网速慢，这一步就可能会耗费几个小时。断网后，这里会自动跳过，等安装好，再设置服务器，选择国内的服务器更新语言包等其它软件。二、安装 JDK 1.7.0_45 依照从ORACLE官网下载jdk-7u45-linux-x64.tar.gz，然后按下面的命令运行即可： 1、 cd /usr/ （注：进入usr目录） 2、sudo mkdir /usr/java （注：在usr下创建java目录） 3、sudo cp /home/jimmy/Downloads/jdk-7u45-linux-x64.tar.gz /usr/java/ （注：将下载的jdk压缩文件，移动到/usr/java下，这里jimmy是ubuntu的用户名，这里根据实际情况换成自己的用户名） 4、sudo tar -zxf jdk-7u45-linux-x64.ta...

2013-10-19

700

工作中经常要用到的一些东西，一直没整理，用的多的记住了，用的不多的每次都是去查，所以记录一下。 DDL（数据定义语言），那就包括建表，修改表结构等等了建表：create hive table 1 hive> CREATE TABLE pokes (foo INT, bar STRING); 创建一个名为pokes的表，包括两个字段，第一个字段foo是整型，第二个字段bar是字符串。 1 hive> CREATE TABLE invites (foo INT, bar STRING) PARTITIONED BY (ds STRING); 创建一个名为invites的表，包括两个字段（列）：foo、bar，和一个分区字段（列）ds。分区字段是虚拟的字段（列）。他不属于数据本身，而是一个特定的数据集。默认情况下表被按照文本格式存储，以ctrl+a分隔列。下面是工作中常用的建表方式（日期表和分区表）：需要解释的地方： 1 ROW FORMAT DELIMITED 2 FIELDS TERMINATED BY '\001' 3 COLLECTION ITEMS TERMIN...

2013-10-23

678

资源下载

更多资源

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长，特征是大鼻子、头戴帽子、身穿背带裤，还留着胡子。与他的双胞胎兄弟路易基一起，长年担任任天堂的招牌角色。

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题，腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构，目前腾讯云软件源站支持公网访问和内网访问。

Nacos

Nacos /nɑ:kəʊs/ 是 Dynamic Naming and Configuration Service 的首字母简称，一个易于构建 AI Agent 应用的动态服务发现、配置管理和AI智能体管理平台。Nacos 致力于帮助您发现、配置和管理微服务及AI智能体应用。Nacos 提供了一组简单易用的特性集，帮助您快速实现动态服务发现、服务配置、服务元数据、流量管理。Nacos 帮助您更敏捷和容易地构建、交付和管理微服务平台。

Spring

Spring框架（Spring Framework）是由Rod Johnson于2002年提出的开源Java企业级应用框架，旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念，提供核心容器、应用上下文、数据访问集成等模块，支持整合Hibernate、Struts等第三方框架，其适用范围不仅限于服务器端开发，绝大多数Java应用均可从中受益。