《R与Hadoop大数据分析实战》一1.6　HDFS和MapReduce架构-低调大师

《R与Hadoop大数据分析实战》一1.6　HDFS和MapReduce架构

2017-07-02 554

本节书摘来自华章出版社《R与Hadoop大数据分析实战》一书中的第1章，第1.6节，作者（印）Vignesh Prajapati，更多章节内容可以访问云栖社区“华章计算机”公众号查看

1.6　HDFS和MapReduce架构

由于HDFS和MapReduce是Hadoop框架的两个主要特征，我们将专注于它们。先从HDFS开始。

1.6.1　HDFS架构

HDFS是主从架构。主HDFS命名为名称节点（NameNode），而从HDFS命名为数据节点（DataNode）。名称节点是一个管理文件系统命名空间和调整客户端文件访问（开启、关闭、重命名及其他操作）的服务器。它将输入数据分块并且公布存储在各个数据节点上的数据。数据节点是一个从装置，它存储分区数据集的副本并且收到请求时提供数据。它还进行块的创建和删除。
HDFS的内部机理可将文件划分为一个

微信关注我们

原文链接：https://yq.aliyun.com/articles/119035

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

Spark 是否真的比 MapReduce 技高一筹

Apache 基金会下的 Spak 再次引爆了大数据的话题。带着比 Hadoop MapReduce 速度要快 100 倍的承诺以及更加灵活方便的 API，一些人认为这或许预示着 Hadoop MapReduce 的终结。作为一个开源的数据处理框架，Spark 是如何做到如此迅速地处理数据的呢?秘密就在于它是运行在集群的内存上的，而且不受限于 MapReduce 的二阶段范式。这大大加快了重复访问同一数据的速度。 Spark 既可以单独运行，也可以运行在 Hadoop YARN 上(注：Hadoop第二代框架中的改进框架，用于将资源管理和处理组件分开，基于YARN的结构不受 MapReduce 约束)，此时 Spark 可以直接从 HDFS (Hadoop Distributed File System 分布式文件系统)中读取数据。诸如 Yahoo(雅虎)、Intel(因特尔)、Baidu(百度)、Trend Micro(趋势科技)和 Groupon(高朋)等公司已经在使用 Spark 了。听上去好像 Spark 已经注定要取代 Hadoop MapReduce 了。但真的是这样...

2017-07-03

492

在大数据时代每家公司都要有大数据部门吗？如果这个问题换做是：在电气时代，每家公司都要有个发电厂吗?是不是会更好回答一些? 事实上每一种重大技术的出现，都会对产业产生大的变化。在蒸汽时代，采矿机采用蒸汽机后，会带来生产效率的极大提升，而轮船加上蒸汽机，再也不需要靠风才能航海了。在电气时代，电灯代替了蜡烛，电报代替了快马送信，而报纸也被广播和电视所侵蚀。可以说是现有产业加上新技术，形成了新产业。我们回过头来看这两次工业革命，生产蒸汽机的企业只有少量几家，而发电的企业在美国也只有通用电气和西屋电气。并不是每家企业都要从事这些基础设施的研发和生产，更多的是对新技术加以应用，发挥新技术带来的价值。在IT领域，软件刚出来时，可以说是计算和存储完全混杂在一起。有人尝试将计算硬件进行分离，歪打正着成就了Intel。有人尝试将存储系统分离，因而有了Oracle。 Intel和Oracle固然伟大，但它们的价值更多的还在于有广大的企业采用了这些新的技术，在具体的行业中，产生了更大的价值。同样，云计算这种理念固然是好，但如果每家企业都建立自己的云计算中心，从资金和人力投入上，一定是不划算的，更严重...

2017-07-03

445

资源下载

更多资源

优质分享App

近一个月的开发和优化，本站点的第一个app全新上线。该app采用极致压缩，本体才4.36MB。系统里面做了大量数据访问、缓存优化。方便用户在手机上查看文章。后续会推出HarmonyOS的适配版本。

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题，腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构，目前腾讯云软件源站支持公网访问和内网访问。

Rocky Linux

Rocky Linux（中文名：洛基）是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版，作为CentOS稳定版停止维护后与RHEL（Red Hat Enterprise Linux）完全兼容的开源替代方案，由社区拥有并管理，支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性，采用模块化包装和SELinux安全架构，默认包含GNOME桌面环境及XFS文件系统，支持十年生命周期更新。

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能，例如代码缩略图，Python的插件，代码段等。还可自定义键绑定，菜单和工具栏。Sublime Text 的主要功能包括：拼写检查，书签，完整的 Python API ， Goto 功能，即时项目切换，多选择，多窗口等等。Sublime Text 是一个跨平台的编辑器，同时支持Windows、Linux、Mac OS X等操作系统。