《Spark核心技术与高级应用》——1.2节Spark的重要扩展-低调大师

《Spark核心技术与高级应用》——1.2节Spark的重要扩展

2017-05-01 681

本节书摘来自华章社区《Spark核心技术与高级应用》一书中的第1章，第1.2节Spark的重要扩展，作者于俊　向海　代其锋　马海平，更多章节内容可以访问云栖社区“华章社区”公众号查看

1.2　Spark的重要扩展
大家知道，在Hadoop中完成即席查询（ad-hoc queries）、批处理（batch processing），流式处理（stream processing），需要构建不同的团队，每个团队需要不同的技术和经验，很难做到共享。而Spark实现了平台融合，一个基础平台解决所有的问题，一个团队拥有相同的技术和经验完成所有的任务。
基于Spark的基础平台扩展了5个主要的Spark库，包括支持结构化数据的Spark SQL、处理实时数据的Spark Streaming、用于机器学习的MLlib、用于图计算的GraphX、用于统计分

微信关注我们

原文链接：https://yq.aliyun.com/articles/108406

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

Spark 源码分析 -- RDD

关于RDD, 详细可以参考Spark的论文, 下面看下源码 A Resilient Distributed Dataset (RDD), the basic abstraction in Spark. Represents an immutable, partitioned collection of elements that can be operated on in parallel. * Internally, each RDD is characterized by five main properties: * - A list of partitions * - A function for computing each split * - A list of dependencies on other RDDs * - Optionally, a Partitioner for key-value RDDs (e.g. to say that the RDD is hash-partitioned) * - Optionally, a list of preferred...

2017-05-01

593

本节书摘来异步社区《HBase管理指南》一书中的第1章，第1.6节，作者：蒋燚峰译者：苏南，更多章节内容可以访问云栖社区“异步社区”公众号查看。 1.6　修改内核参数设置 HBase是运行在Hadoop上的数据库，和其他数据库一样，它也要同时打开很多个文件。Linux对于一个进程可打开文件描述符的个数有所限制。默认的限制是每个进程可打开1024个文件。为了使HBase能够顺畅运行，你需要调高启动HBase的那个用户允许打开的文件描述符的最大个数。在本书中，就是hadoop用户。你还要调高Hadoop的nproc设置。nproc设置指定了用户可以同时启动的最大进程数量。如果nproc过低，就会遇到OutOfMemoryError这种错误。本节将描述如何显示和更改这些内核参数。 1.6.1　准备请确保你在所有服务器上都有root权限。 1.6.2　操作步骤你需要对集群中的所有服务器进行如下的内核参数设置修改。 1．以hadoop用户的身份登录并执行以下命令，以确认可打开文件数的当前限制。 hadoop$ ulimit -n 1024 2．使用-u选项的ulimit命令来查看最...

2017-05-01

700

资源下载

更多资源

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题，腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构，目前腾讯云软件源站支持公网访问和内网访问。

Spring

Spring框架（Spring Framework）是由Rod Johnson于2002年提出的开源Java企业级应用框架，旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念，提供核心容器、应用上下文、数据访问集成等模块，支持整合Hibernate、Struts等第三方框架，其适用范围不仅限于服务器端开发，绝大多数Java应用均可从中受益。

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能，例如代码缩略图，Python的插件，代码段等。还可自定义键绑定，菜单和工具栏。Sublime Text 的主要功能包括：拼写检查，书签，完整的 Python API ， Goto 功能，即时项目切换，多选择，多窗口等等。Sublime Text 是一个跨平台的编辑器，同时支持Windows、Linux、Mac OS X等操作系统。

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源，继承了IntelliJ IDEA强大的JS部分的功能。