《Spark Cookbook 中文版》一导读-低调大师

《Spark Cookbook 中文版》一导读

2017-05-01 575

前言

Spark Cookbook 中文版
随着Hadoop这个大数据平台的成功，用户的期望也水涨船高，他们既希望解决不同分析问题的功能提高，又希望减少延迟。由此，各类工具应运而生。Apache Spark这个可以解决所有问题的单一平台也出现在了Hadoop的大舞台上。“Spark一出，谁与争锋”，它终结了需要使用多种工具来完成复杂挑战和学习曲线的局面。通过使用内存进行持久化存储和计算，Apache Spark避免了磁盘上的中间存储过程并将速度提高了100倍，并且提供了一个单一平台用来完成诸如机器学习、实时streaming等诸多分析作业。

第1章　 [开始使用Apache Spark]()
1.1　 [简介]()
1.2　 [使用二进制文件安装Spark]()
1.3　 [通过Maven构建Spark源码]()
1.4　 [在Amazon EC2上部署Spark]()
1.5　 [在集群上以独立模式部署Spark]()
1.6　 [在集群上使用Mesos部署Spark]()
1.7　 [在集群上使用YARN部署]()
1.8　 [使用Tachyon作为堆外存储层]()
第2章　使用Spark开发应用
第3章　外部数据源
第4章　Spark SQL
第5章　Spark Streaming
第6章　机器学习——MLlib
第7章　监督学习之回归——MLlib
第8章　监督学习之分类——MLlib
第9章　无监督学习——MLlib
第10章　推荐系统
第11章　图像处理——GraphX
第12章　优化及调优

微信关注我们

原文链接：https://yq.aliyun.com/articles/98130

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

《Hadoop海量数据处理：技术详解与项目实战》一1.3 数据挖掘和商业智能

本节书摘来异步社区《Hadoop海量数据处理：技术详解与项目实战》一书中的第1章，第1.3节，作者：范东来责编：杨海玲，更多章节内容可以访问云栖社区“异步社区”公众号查看。 1.3 数据挖掘和商业智能 Hadoop海量数据处理：技术详解与项目实战和云计算、大数据的概念相比，数据挖掘和商业智能的概念早已被学术界和工业界所接受，但由于大数据的出现，又为它们注入了新的活力，“大数据时代的商业智能”的概念不断被业界所提及，那么它们究竟是什么呢？ 1.3.1 数据挖掘的定义先来看一个例子，Google的Flu Trends（流感趋势）使用特殊的搜索项作为流感活动的指示器。它发现了搜索流感相关信息的人数与实际具有流感症状的人数之间的紧密联系。当与流感相关的所有搜索聚集在一起时，一个模式就出现了。使用聚集的搜索数据，Google的Flu Trends可以比传统的系统早两周对流感活动做出评估。这个例子说明了数据挖掘如何把大型数据集转化为知识。现在，我们可以对数据挖掘做一个简短的定义，数据挖掘就是“数据→知识”。带着这个概念，我们来一步一步分析数据挖掘的本质。数据挖掘可以看作是信息技术自然而然...

2017-05-02

518

本节书摘来自华章出版社《循序渐进学Spark》一书中的第1章，第1.6节，作者小象学院　杨　磊，更多章节内容可以访问云栖社区“华章计算机”公众号查看。 1.6　使用Spark Shell开发运行Spark程序 Spark Shell是一种学习API的简单途径，也是分析数据集交互的有力工具。虽然本章还没涉及Spark的具体技术细节，但从总体上说，Spark弹性数据集RDD有两种创建方式：从文件系统输入（如HDFS）。从已存在的RDD转换得到新的RDD。现在我们从RDD入手，利用Spark Shell简单演示如何书写并运行Spark程序。下面以word count这个经典例子来说明。 1）启动spark shell: cd 进SPARK_HOME/bin，执行命令。 ./spark-shell 2）进入scala命令行，执行如下命令： sca

2017-05-02

453

资源下载

更多资源

优质分享App

近一个月的开发和优化，本站点的第一个app全新上线。该app采用极致压缩，本体才4.36MB。系统里面做了大量数据访问、缓存优化。方便用户在手机上查看文章。后续会推出HarmonyOS的适配版本。

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长，特征是大鼻子、头戴帽子、身穿背带裤，还留着胡子。与他的双胞胎兄弟路易基一起，长年担任任天堂的招牌角色。

Nacos

Nacos /nɑ:kəʊs/ 是 Dynamic Naming and Configuration Service 的首字母简称，一个易于构建 AI Agent 应用的动态服务发现、配置管理和AI智能体管理平台。Nacos 致力于帮助您发现、配置和管理微服务及AI智能体应用。Nacos 提供了一组简单易用的特性集，帮助您快速实现动态服务发现、服务配置、服务元数据、流量管理。Nacos 帮助您更敏捷和容易地构建、交付和管理微服务平台。

Rocky Linux

Rocky Linux（中文名：洛基）是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版，作为CentOS稳定版停止维护后与RHEL（Red Hat Enterprise Linux）完全兼容的开源替代方案，由社区拥有并管理，支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性，采用模块化包装和SELinux安全架构，默认包含GNOME桌面环境及XFS文件系统，支持十年生命周期更新。

《Spark Cookbook 中文版》一导读

前言