首页 文章 精选 留言 我的

精选列表

搜索[运维],共10003篇文章
优秀的个人博客,低调大师

Hadoop运维操作

1. 处理hadoop的namenode宕机 处理措施: 进入hadoop的bin目录,重启namenode服务 操作命令: cd path/to/hadoop/bin ./hadoop-daemon.sh start namenode 2. 处理hadoop的jobtacker宕机 处理措施: 进入hadoop的bin目录,重启jobtacker服务 操作命令: cd path/to/hadoop/bin ./hadoop-daemon.sh start jobtracker 3. 处理hadoop的datanode宕机 处理措施: 进入hadoop的bin目录,重启datanode服务 操作命令: cd path/to/hadoop/bin ./hadoop-daemon.sh start datanode 4. 处理hadoop的tasktracker宕机 处理措施: 进入hadoop的bin目录,重启tasktacker服务 操作命令: cd path/to/hadoop/bin ./hadoop-daemon.sh start tasktracker 5. 启动hadoop集群 处理措施: 进入hadoop的bin目录,执行start-all.sh脚本 操作命令: cd path/to/hadoop/bin ./start-all.sh 注意事项: namenode在启动的时候首先进入安全模式,如果datanode丢失的block达到一定的比例(1- dfs.safemode.threshold.pct),则系统会一直处于安全模式状态即只读状态。 dfs.safemode.threshold.pct(缺省值0.999f)表示hdfs启动的时候,如果datanode上报的block个数达到了 元数据记录的block个数的0.999倍才可以离开安全模式,否则一直是这种只读模式。如果设为1则hdfs永远是处于safemode。 有两个方法离开这种安全模式 (1)修改dfs.safemode.threshold.pct为一个比较小的值,缺省是0.999。 (2)hadoop dfsadmin -safemode leave命令强制离开 用户可以通过dfsadmin -safemode $value来操作安全模式,参数$value的说明如下: enter – 进入安全模式 leave – 强制namenode离开安全模式 get – 返回安全模式是否开启的信息 wait – 等待,一直到安全模式结束。 6. 关闭hadoop机器 处理措施: 进入hadoop的bin目录,执行stop-all.sh脚本 操作命令: cd path/to/hadoop/bin ./ stop-all.sh 7. 从hadoop移除机器 处理措施: 把需要移除的机器增加到exclueds文件中,强制刷新datanode列表,等待decommission状态正常后,即可停机下架,如有必要在namenode执行balancer操作。 操作命令: 在master的conf/hdfs-site.xml中加入 <property> <name>dfs.hosts.exclude</name> <value>excludes</value> </property> 在$hadoop_home下创建exclueds文件 文件内容增加你想删除的节点的机器名,一行一个 /bin/hadoop dfsadmin -refreshnodes命令刷新datanode例表 /bin/hadoop dfsadmin -report查看结果 datanodes available: 1 (1 total, 0 dead) name: 192.168.200.118:50010 decommission status : decommission in progress configured capacity: 211370565632 (196.85 gb) dfs used: 11459694592 (10.67 gb) non dfs used: 187135799296 (174.28 gb) dfs remaining: 12775071744(11.9 gb) dfs used%: 5.42% dfs remaining%: 6.04% last contact: wed feb 22 23:51:48 pst 2012 在decommission status : decommission in progress变为 decommission status : decommission normal前mapreduce会异常增加节点 8. 向hadoop添加机器 处理措施: 把新机器的增加到conf/slaves文件中,重启datanode和jobtracker进程,当新添加的机器向namenode发送心跳信息后,namenode会自动感知新加入的机器,如果有必要可以做balancer操作。 操作命令: 1.把新机器的增加到conf/slaves文件中(datanode或者tasktracker crash则可跳过) 2.在新机器上进入hadoop安装目录 $bin/hadoop-daemon.sh start datanode $bin/hadoop-daemon.sh start tasktracker 3.在namenode上 $bin/hadoop balancer 9. 杀死正在运行的job 操作命令: bin/hadoop job –kill {job-id} 10.处理hbase的master宕机 操作命令: ./hbase-daemon.sh start master ./hbase-daemon.sh start zookeeper//可选 11.处理hbase的regionserver宕机 操作命令: ./hbase-daemon.sh start regionserver ./hbase-deamon.sh start zookeeper//可选 12.hbase集群间数据迁移方法总结 一、需要在hbase集群停掉的情况下迁移 步骤: (1)执行hadoop distcp -f filelist "hdfs://new cluster ip:9000/hbasetest" (2)在new cluster执行./hbase org.jruby.main add_table.rb /hbase/table20111222,将拷贝来的表加入到.meat.中(会出现region的数目不一致的问题,这个需要重启hase才能解决) 说明:(1)filelist为hdfs上的列表文件,内容如下: /hbase/table20111222 /hbase/table20120131 (2)如果两个集群的hadoop版本不一致,需要在new cluster上执行hadoop distcp,否则会出现读写异常; 二、在集群运行的时候进行数据迁移 1、replication:这个是动态的备份(可以理解为实时备份) 步骤:(1)在old cluster将需要迁移的表属性进行修改: disable 'your_table' alter 'your_table', {name => 'family_name', replication_scope => '1'} enable 'your_table' (2)打开new cluster集群的replication,修改hbase-site.xml <property> <name>hbase.replication</name> <value>true</value> </property> (3)添加peer,在new cluster的hbase shell中执行:add_peer '1','old cluster ip:2181:/hbase',启动replication,执行start_replication 说明:需要两个集群的hadoop版本一致,否则出现读写错误 2、copytable:可以在本集群中拷贝一张表,也可以将表拷贝到其他的集群中。 命令:./hbase org.apache.hadoop.hbase.mapreduce.copytable --peer.adr=new cluster ip:2181:/hbase zy_test 说明:(1)拷贝完成,不需要重启机器,在new cluster中就可以看到该表; (2)稳定性还需要考虑,测试过程中遇到一个问题 此文来自:马开东博客 转载请注明出处 网址:http://www.makaidong.com ,拷贝过程中始终都停留在这里lookedup root region location, 查看日志没有什么错误和相关的信息。 3、export and import 步骤:(1)在old cluster上执行:./hbase org.apache.hadoop.hbase.mapreduce.export test hdfs://new cluster ip:9000/zhuangyang/test (2)在new cluster上执行:./hbase org.apache.hadoop.hbase.mapreduce.import test hdfs://new cluster ip:9000/zhuangyang/test 说明:(1)一定要写全路径,不能写相对路劲; (2)在import前,需要将表事先在new cluster中创建好. 以上都是在old cluster和new cluster网络相通的情况下实现数据迁移的办法。 如果两个集群网络不通,只能先将old cluster中的数据都下载到本地或者其他的地方,然后在人工的转移到new cluster上了 13.不重启namenode可以使配置文件生效 hadoop dfsadmin -refreshnodes 14.清空垃圾回收站 [root@master data]# hadoop fs -rmr .Trash Deleted hdfs://master:9000/user/root/.Trash 此文链接:http://www.makaidong.com/%E5%8D%9A%E5%AE%A2%E5%9B%AD%E6%8E%92%E8%A1%8C/9639.shtml 本文转自茄子_2008博客园博客,原文链接:http://www.cnblogs.com/xd502djj/p/4675217.html,如需转载请自行联系原作者。

优秀的个人博客,低调大师

Enterprise Suse运维

1,Suse CDH4安装 wget archive.cloudera.com/cdh4/one-click-install/redhat/6/x86_64/cloudera-cdh-4-0.x86_64.rpm cloudera-cdh4.repo内容 [cloudera-cdh4] name=Cloudera's Distribution for Hadoop, Version 4 baseurl=http://archive.cloudera.com/cdh4/redhat/6/x86_64/cdh/4/ gpgkey = http://archive.cloudera.com/cdh4/redhat/6/x86_64/cdh/RPM-GPG-KEY-cloudera gpgcheck = 1 suse包管理工具zypper 与 yast;Ubuntu dpkg 与 apt; lsblk 列出所有的块设备,而且还能显示他们之间的依赖关系 参数: -a, --all 显示所有设备-b, --bytes 以bytes方式显示设备大小-d, --nodeps 不显示 slaves 或 holders-D, --discard print discard capabilities-e, --exclude <list> 排除设备 (default: RAM disks)-f, --fs 显示文件系统信息-h, --help 显示帮助信息-i, --ascii use ascii characters only-m, --perms 显示权限信息-l, --list 使用列表格式显示-n, --noheadings 不显示标题-o, --output <list> 输出列-P, --pairs 使用key="value"格式显示-r, --raw 使用原始格式显示-t, --topology 显示拓扑结构信息 http://l.51yip.com/search/lsblk;

优秀的个人博客,低调大师

spark 运维实战 简介

Spark大数据计算框架、架构、计算模型和数据管理策略及 Spark在工业界的应用。围绕 Spark的 BDAS项目及其子项目进行了简要介绍。目前,Spark生态系统已经发展成为一个包含多个子项目的集合,其中包含 SparkSQL、Spark Streaming、GraphX、 MLlib 等子项目,本章只进行简要介绍,后续章节再详细阐述。 1.1Spark 是什么 Spark 是基于内存计算的大数据并行计算框架。Spark 基于内存计算,提高了在大数据环境下数据处理的实时性,同时保证了高容错性和高可伸缩性,允许用户将 Spark部署在大量廉价硬件之上,形成集群。 Spark 于2009 年诞生于加州大学伯克利分校AMPLab。目前,已经成为Apache 软件基金会旗下的顶级开源项目。下面是 Spark的发展历程。 1.Spark 的历史与发展 2009 年:Spark 诞生于AMPLab。 2010 年:开源。 2013 年6 月:Apache 孵化器项目。 2014 年2 月:Apache 顶级项目。 2014 年2 月:大数据公司Cloudera 宣称加大Spark 框架的投入来取代MapReduce。 2014 年4 月:大数据公司MapR 投入Spark 阵营,Apache Mahout 放弃MapReduce, 将使用 Spark作为计算引擎。 2014 年5 月:Pivotal Hadoop 集成Spark 全栈。 2014 年5 月30 日:Spark 1.0.0 发布。 2014 年6 月:Spark 2014 峰会在旧金山召开。 2014 年7 月:Hive on Spark 项目启动。 目前 AMPLab和 Databricks负责整个项目的开发维护,很多公司,如 Yahoo!、Intel等 参与到 Spark的开发中,同时很多开源爱好者积极参与 Spark的更新与维护。 AMPLab 开发以Spark 为核心的BDAS 时提出的目标是:one stack to rule them all,也 就是说在一套软件栈内完成各种大数据分析任务。相对于 MapReduce上的批量计算、迭代型计算以及基于 Hive的 SQL查询,Spark可以带来上百倍的性能提升。目前 Spark的生态系统日趋完善,Spark SQL的发布、Hive on Spark项目的启动以及大量大数据公司对 Spark全栈的支持,让 Spark的数据分析范式更加丰富。 2.Spark 之于Hadoop 更准确地说,Spark是一个计算框架,而 Hadoop中包含计算框架 MapReduce和分布式文件系统 HDFS,Hadoop更广泛地说还包括在其生态系统上的其他系统,如 Hbase、 Hive 等。 Spark 是MapReduce 的替代方案,而且兼容HDFS、Hive 等分布式存储层,可融入 Hadoop 的生态系统,以弥补缺失MapReduce 的不足。Spark 相比Hadoop MapReduce 的优势 如下。 (1)中间结果输出基于 MapReduce的计算引擎通常会将中间结果输出到磁盘上,进行存储和容错。出于 任务管道承接的考虑,当一些查询翻译到 MapReduce任务时,往往会产生多个 Stage,而这些串联的 Stage又依赖于底层文件系统(如 HDFS)来存储每一个 Stage的输出结果。 Spark 将执行模型抽象为通用的有向无环图执行计划(DAG),这可以将多Stage 的任务串联或者并行执行,而无须将 Stage中间结果输出到 HDFS中。类似的引擎包括 Dryad、 Tez。 (2)数据格式和内存布局由于 MapReduce Schema on Read处理方式会引起较大的处理开销。Spark抽象出分布式内存存储结构弹性分布式数据集 RDD,进行数据的存储。RDD能支持粗粒度写操作,但对于读取操作,RDD可以精确到每条记录,这使得 RDD可以用来作为分布式索引。 Spark的特性是能够控制数据在不同节点上的分区,用户可以自定义分区策略,如 Hash分区等。 Shark 和Spark SQL 在Spark 的基础之上实现了列存储和列存储压缩。 (3)执行策略 MapReduce 在数据Shuffle 之前花费了大量的时间来排序,Spark 则可减轻上述问题带 来的开销。因为 Spark任务在 Shuffle中不是所有情景都需要排序,所以支持基于 Hash的分布式聚合,调度中采用更为通用的任务执行计划图(DAG),每一轮次的输出结果在内存缓存。 (4)任务调度的开销传统的 MapReduce系统,如 Hadoop,是为了运行长达数小时的批量作业而设计的,在 某些极端情况下,提交一个任务的延迟非常高。 Spark 采用了事件驱动的类库AKKA 来启动任务,通过线程池复用线程来避免进程或线程启动和切换开销。 3.Spark 能带来什么 Spark 的一站式解决方案有很多的优势,具体如下。(1)打造全栈多计算范式的高效数据流水线 Spark 支持复杂查询。在简单的“map ”及“reduce ”操作之外,Spark 还支持SQL 查询、流式计算、机器学习和图算法。同时,用户可以在同一个工作流中无缝搭配这些计算范式。 (2)轻量级快速处理 Spark 1.0 核心代码只有4 万行。这是由于Scala 语言的简洁和丰富的表达力,以及 Spark 充分利用和集成Hadoop 等其他第三方组件,同时着眼于大数据处理,数据处理速度是至关重要的,Spark通过将中间结果缓存在内存减少磁盘 I/O来达到性能的提升。 (3)易于使用,Spark支持多语言 Spark 支持通过Scala、Java 及Python 编写程序,这允许开发者在自己熟悉的语言环境 下进行工作。它自带了 80多个算子,同时允许在 Shell中进行交互式计算。用户可以利用 Spark 像书写单机程序一样书写分布式程序,轻松利用Spark 搭建大数据内存计算平台并充分利用内存计算,实现海量数据的实时处理。 (4)与 HDFS等存储层兼容 Spark 可以独立运行,除了可以运行在当下的YARN 等集群管理系统之外,它还可以读取已有的任何 Hadoop数据。这是个非常大的优势,它可以运行在任何 Hadoop数据源上,0Hive、HBase、HDFS 等。这个特性让用户可以轻易迁移已有的持久化层数据。(5)社区活跃度高 Spark 起源于2009 年,当下已有超过50 个机构、260 个工程师贡献过代码。开源系统的发展不应只看一时之快,更重要的是支持一个活跃的社区和强大的生态系统。 同时我们也应该看到 Spark并不是完美的,RDD模型适合的是粗粒度的全局数据并行计算。不适合细粒度的、需要异步更新的计算。对于一些计算需求,如果要针对特定工作负载达到最优性能,还是需要使用一些其他的大数据系统。例如,图计算领域的 GraphLab在特定计算负载性能上优于 GraphX,流计算中的 Storm在实时性要求很高的场合要比 Spark Streaming 更胜一筹。 随着 Spark发展势头日趋迅猛,它已被广泛应用于 Yahoo!、Twitter、阿里巴巴、百度、网易、英特尔等各大公司的生产环境中。

资源下载

更多资源
Mario

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长,特征是大鼻子、头戴帽子、身穿背带裤,还留着胡子。与他的双胞胎兄弟路易基一起,长年担任任天堂的招牌角色。

腾讯云软件源

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题,腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构,目前腾讯云软件源站支持公网访问和内网访问。

Spring

Spring

Spring框架(Spring Framework)是由Rod Johnson于2002年提出的开源Java企业级应用框架,旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念,提供核心容器、应用上下文、数据访问集成等模块,支持整合Hibernate、Struts等第三方框架,其适用范围不仅限于服务器端开发,绝大多数Java应用均可从中受益。

Rocky Linux

Rocky Linux

Rocky Linux(中文名:洛基)是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版,作为CentOS稳定版停止维护后与RHEL(Red Hat Enterprise Linux)完全兼容的开源替代方案,由社区拥有并管理,支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性,采用模块化包装和SELinux安全架构,默认包含GNOME桌面环境及XFS文件系统,支持十年生命周期更新。

用户登录
用户注册