《智能数据时代：企业大数据战略与实战》一1.5　大数据环境下的处理分析工具-低调大师

《智能数据时代：企业大数据战略与实战》一1.5　大数据环境下的处理分析工具

2017-05-01 629

.本节书摘来自华章出版社《智能数据时代：企业大数据战略与实战》一书中的第1章，第1.5节，作者 TalkingData ，更多章节内容可以访问云栖社区“华章计算机”公众号查看

1.5　大数据环境下的处理分析工具

Apache Hadoop
Apache Hadoop（包括基于它的各种包装，以下通称Hadoop）是一种开源工具，它提供了处理大数据的新平台。虽然Hadoop已经存在一段时间了，但是越来越多的企业才刚刚开始利用其功能。Hadoop平台旨在解决大量数据造成的问题，特别是包含复杂结构化数据和非结构化数据的混合数据，这些数据不适合放在表中。Hadoop在需要深度分析和计算量大（如集群和定位）的情况下运行良好。

对于寻求利用大数据的决策者而言，Hadoop解决了与大数据相关的最常见的问题：以高效的方式存储和访问大量数据。
Hadoop的内

微信关注我们

原文链接：https://yq.aliyun.com/articles/110254

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

Spark 源码分析 -- Stage

理解stage, 关键就是理解Narrow Dependency和Wide Dependency, 可能还是觉得比较难理解关键在于是否需要shuffle, 不需要shuffle是可以随意并发的, 所以stage的边界就是需要shuffle的地方, 如下图很清楚并且Stage分为两种, shuffle map stage, in which case its tasks' results are input for another stage 其实就是,非最终stage, 后面还有其他的stage, 所以它的输出一定是需要shuffle并作为后续的输入result stage, in which case its tasks directly compute the action that initiated a job (e.g. count(), save(), etc) 最终的stage, 没有输出, 而是直接产生结果或存储 1 stage class 这个注释写的很清楚可以看到stage的RDD参数只有一个RDD, final RDD, 而不是一系列的RDD 因为在一个s...

2017-05-02

652

Task是介于DAGScheduler和TaskScheduler中间的接口在DAGScheduler, 需要把DAG中的每个stage的每个partitions封装成task 最终把taskset提交给TaskScheduler /** * A task to execute on a worker node. */ private[spark] abstract class Task[T](val stageId: Int) extends Serializable { def run(attemptId: Long): T //Task的核心函数 def preferredLocations: Seq[TaskLocation] = Nil //Spark关注locality,可以选择该task运行的location var epoch: Long = -1 // Map output tracker epoch. Will be set by TaskScheduler. var metrics: Option[TaskMetrics] = None } TaskCont...

2017-05-02

561

资源下载

更多资源

优质分享App

近一个月的开发和优化，本站点的第一个app全新上线。该app采用极致压缩，本体才4.36MB。系统里面做了大量数据访问、缓存优化。方便用户在手机上查看文章。后续会推出HarmonyOS的适配版本。

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长，特征是大鼻子、头戴帽子、身穿背带裤，还留着胡子。与他的双胞胎兄弟路易基一起，长年担任任天堂的招牌角色。

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题，腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构，目前腾讯云软件源站支持公网访问和内网访问。

Rocky Linux

Rocky Linux（中文名：洛基）是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版，作为CentOS稳定版停止维护后与RHEL（Red Hat Enterprise Linux）完全兼容的开源替代方案，由社区拥有并管理，支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性，采用模块化包装和SELinux安全架构，默认包含GNOME桌面环境及XFS文件系统，支持十年生命周期更新。