学hadoop需要什么基础-低调大师

学hadoop需要什么基础

2018-09-19 612

最近一段时间一直在接触关于hadoop方面的内容，从刚接触时的一片空白，到现在也能够说清楚一些问题。这中间到底经历过什么只怕也就是只有经过的人才会体会到吧。前几天看到有个人问“学hadoop需要什么基础”，这个问题好像至今还没好好细想过，可能是因为身边有大神在带着我学习hadoop的缘故，也就没想过这样的一个简单的问题。

我们目前在用的hadoop版本并不是原生态的版本，我们在用的是国内的一款商业发行版，叫DKhadoop。大快搜索推出的一款原生态开发的Hadoop集成生态环境。从使用的效果上看DKhadoop与开源环境是可以做到完全兼容的。准备过段时间抽个空，试着写一下以DKhadoop为切入点关于学习hadoop需要掌握什么基础。

【DKhadoop基础技术架构图】

关于学hadoop需要什么基础这样的问题，看到一篇关于介绍学习原生hadoop的分享，个人觉得还是很不错的一篇文章。这里也分享给大家，供参考之用。

关于学习hadoop需要具备什么基础知识，首先应该从整体了解hadoop，包括hadoop是什么，能够帮助我们解决什么问题，以及hadoop的使用场景等。在有了整体上的了解后，就可以开始系统的学习hadoop。当然，若是能够结合一些实践性的东西学习会更有助于理解hadoop。

学习hadoop需要什么基础：

Linux：

â ã 需要能够熟练操作linux常用命令以及网络配置；

â¡ã 熟悉用户以及权限管理操作；

â¢ã 需要熟悉软件包以及系统命令管理；

â£ã 还需要学习一下shell编程。

Java：

â¤ã 需要具备一定的javase基础知识；

â¥ã 如果懂java web及各种框架知识那就更好了。

虚拟机：

â¦ã 需要掌握虚拟机；

â§ã 需要安装linux操作系统

â¨ã 需要配置虚拟机网络

除了上述这几个方面，我们还需要了解hadoop的单机模式、伪分布模式和分布式模式的搭建方式。了解MapReduce分布式计算框架、Yarn集群资源管理和调度平台、hdfs分布式文件系统、hive数据仓库、HBase实时分布式数据库、Flume日志收集工具、sqoop数据库ETL工具、zookeeper分布式协作服务、Mahout数据挖掘库等。

微信关注我们

原文链接：https://yq.aliyun.com/articles/642546

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

hive核心基本概念

版权声明：本文为博主原创文章，未经博主允许不得转载。 https://blog.csdn.net/xmt1139057136/article/details/82785696 1.什么是hive 基于 Hadoop 的一个数据仓库工具： hive本身不提供数据存储功能，使用HDFS做数据存储， hive也不分布式计算框架，hive的核心工作就是把sql语句翻译成MR程序 hive也不提供资源调度系统，也是默认由Hadoop当中YARN集群来调度可以将结构化的数据映射为一张数据库表，并提供 HQL(Hive SQL)查询功能 2.hive和Hadoop关系 Hive利用HDFS存储数据，利用MapReduce查询数据 3.hive和传统数据库的区别总结：hive具有sql数据库的外表，但应用场景完全不同，hive只适合用来做批量数据统计分析 4.hive数据的存储 1、Hive中所有的数据都存储在 HDFS 中，没有专门的数据存储格式（可支持Text，SequenceFile，ParquetFile，RCFILE等） 2、只需要在创建表的时候告诉 Hive 数据中的列分隔符和行分隔...

2018-09-19

764

阿里云EMR-3.13.0版本的SparkSQL支持自适应执行功能。解决哪些问题 SparkSQL自适应执行解决以下问题: shuffle partition个数目前SparkSQL中reduce阶段的task个数取决于固定参数spark.sql.shuffle.partition(默认值200)，一个作业一旦设置了该参数，它运行过程中的所有阶段的reduce个数都是同一个值。而对于不同的作业，以及同一个作业内的不同reduce阶段，实际的数据量大小可能相差很大，比如reduce阶段要处理的数据可能是10MB，也有可能是100GB, 如果使用同一个值对实际运行效率会产生很大影响，比如10MB的数据一个task就可以解决，如果spark.sql.shuffle.partition使用默认值200的话，那么10MB的数据就要被分成200个

2018-09-19

748

资源下载

更多资源

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长，特征是大鼻子、头戴帽子、身穿背带裤，还留着胡子。与他的双胞胎兄弟路易基一起，长年担任任天堂的招牌角色。

Spring

Spring框架（Spring Framework）是由Rod Johnson于2002年提出的开源Java企业级应用框架，旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念，提供核心容器、应用上下文、数据访问集成等模块，支持整合Hibernate、Struts等第三方框架，其适用范围不仅限于服务器端开发，绝大多数Java应用均可从中受益。

Rocky Linux

Rocky Linux（中文名：洛基）是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版，作为CentOS稳定版停止维护后与RHEL（Red Hat Enterprise Linux）完全兼容的开源替代方案，由社区拥有并管理，支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性，采用模块化包装和SELinux安全架构，默认包含GNOME桌面环境及XFS文件系统，支持十年生命周期更新。

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源，继承了IntelliJ IDEA强大的JS部分的功能。