大数据学习笔记(三):HDFS分布式文件系统架构原理详解

在网易云课堂买了卡夫卡的大数据课程,开始学习咯!

HDFS分布式文件系统

解决问题:海量数据的存储——>分布式结构设计

分布式的特点:

  1. 集群,有多台机器共同协作完成存储
  2. 主从架构设计

HDFS设计思想

1.namenode -主节点 -领导

  • 主要存储文件的属性信息,即文件的元数据

    • 文件的名称
    • 文件的位置
    • 文件的副本数
    • 文件的拥有者、组、权限
    • 存储快
    • 各个块在哪些datanode节点上

2.datanode -从节点 -随从

  • 存储具体的文件
    image

简单解释一下上图
1.不同的交换机在不同的机架上,存储文件在不同的机架上,当一个机架中的副本损坏,可以通过最近的一个机架去恢复数据。
2.读文件和写文件,如图上图所示:

  • 读文件:客户端先去找namenode拿到文件的元数据,知道文件存储在哪一个datanode上(遵循就近的原则),然后去读文件。
  • 写文件:客户端先去namenode去请求,在哪台机器可以写。

读文件:

  • client -> namenode
  • client ->datanode

写文件

  • client ->namenode
  • client ->datanode
优秀的个人博客,低调大师

微信关注我们

原文链接:https://yq.aliyun.com/articles/507906

转载内容版权归作者及来源网站所有!

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

相关文章

发表评论

资源下载

更多资源
优质分享Android(本站安卓app)

优质分享Android(本站安卓app)

近一个月的开发和优化,本站点的第一个app全新上线。该app采用极致压缩,本体才4.36MB。系统里面做了大量数据访问、缓存优化。方便用户在手机上查看文章。后续会推出HarmonyOS的适配版本。

Oracle Database,又名Oracle RDBMS

Oracle Database,又名Oracle RDBMS

Oracle Database,又名Oracle RDBMS,或简称Oracle。是甲骨文公司的一款关系数据库管理系统。它是在数据库领域一直处于领先地位的产品。可以说Oracle数据库系统是目前世界上流行的关系数据库管理系统,系统可移植性好、使用方便、功能强,适用于各类大、中、小、微机环境。它是一种高效率、可靠性好的、适应高吞吐量的数据库方案。

Eclipse(集成开发环境)

Eclipse(集成开发环境)

Eclipse 是一个开放源代码的、基于Java的可扩展开发平台。就其本身而言,它只是一个框架和一组服务,用于通过插件组件构建开发环境。幸运的是,Eclipse 附带了一个标准的插件集,包括Java开发工具(Java Development Kit,JDK)。

Sublime Text 一个代码编辑器

Sublime Text 一个代码编辑器

Sublime Text具有漂亮的用户界面和强大的功能,例如代码缩略图,Python的插件,代码段等。还可自定义键绑定,菜单和工具栏。Sublime Text 的主要功能包括:拼写检查,书签,完整的 Python API , Goto 功能,即时项目切换,多选择,多窗口等等。Sublime Text 是一个跨平台的编辑器,同时支持Windows、Linux、Mac OS X等操作系统。