《深入理解Spark:核心思想与源码分析》——1.3节阅读环境准备-低调大师

《深入理解Spark:核心思想与源码分析》——1.3节阅读环境准备

2017-05-01 556

本节书摘来自华章社区《深入理解Spark:核心思想与源码分析》一书中的第1章，第1.3节阅读环境准备，作者耿嘉安，更多章节内容可以访问云栖社区“华章社区”公众号查看

1.3　阅读环境准备
准备Spark阅读环境，同样需要一台好机器。笔者调试源码的机器的内存是8 GB。源码阅读的前提是在IDE环境中打包、编译通过。常用的IDE有IntelliJ IDEA、Eclipse。笔者选择用Eclipse编译Spark，原因有二：一是由于使用多年对它比较熟悉，二是社区中使用Eclipse编译Spark的资料太少，在这里可以做个补充。在Windows系统编译Spark源码，除了安装JDK外，还需要安装以下工具。
（1）安装Scala
由于Spark 1.20版本的sbt里指定的Scala版本是2.10.4，具体见Spark源码目录下的文件projectplugins.sbt，其中有一行：scalaVersion := "2.10.4"。所以选择下载scala-2.10.4.msi，下载地址：http://www.scala-lang.org/download/。
下载完毕，安装scala-2.10.4.msi。
（2）安装SBT
由于Scala使用SBT作为构建工具，所以需要下载SBT。下载地址：http://www.scala-sbt.org/，下载最新的安装包sbt-0.13.8.msi并安装。
（3）安装Git Bash
由于Spark源码使用Git作为版本控制工具，所以需要下载Git的客户端工具，推荐使用Git Bash，因为它更符合Linux下的操作习惯。下载地址：http://msysgit.github.io/，下载最新的版本并安装。
（4）安装Eclipse Scala IDE插件
Eclipse通过强大的插件方式支持各种IDE工具的集成，要在Eclipse中编译、调试、运行Scala程序，就需要安装Eclipse Scala IDE插件。下载地址：http://scala-ide.org/download/current.html。
由于笔者本地的Eclipse版本是Eclipse 4.4 (Luna)，所以选择安装插件http://download.scala-ide.org/sdk/lithium/e44/scala211/stable/site，如图1-14所示。

da5f41c5e21b195b8aa2b56dd0737795ca463a18

在Eclipse中选择Help菜单，然后选择Install New Software…选项，打开Install对话框，如图1-15所示。

3c1401af68bdebb23d8dc02eca2d232b0d945253

微信关注我们

原文链接：https://yq.aliyun.com/articles/107734

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

《Hadoop大数据分析与挖掘实战》——1.3节数据挖掘的基本任务

本节书摘来自华章社区《Hadoop大数据分析与挖掘实战》一书中的第1章，第1.3节数据挖掘的基本任务，作者张良均　樊哲　赵云龙　李成华　，更多章节内容可以访问云栖社区“华章社区”公众号查看 1.3　数据挖掘的基本任务数据挖掘的基本任务包括利用分类与预测、聚类分析、关联规则、时序模式、偏差检测、智能推荐等方法，帮助企业提取数据中蕴含的商业价值，提高企业的竞争力。对餐饮企业而言，数据挖掘的基本任务是从餐饮企业采集各类菜品销量、成本单价、会员消费、促销活动等内部数据，以及天气、节假日、竞争对手以及周边商业氛围等外部数据；之后利用数据分析手段，实现菜品智能推荐、促销效果分析、客户价值分析、新店选点优化、热销/滞销菜品分析和销量趋势预测；最后将这些分析结果推送给餐饮企业管理者及有关服务人员，为餐饮企业降低运营成本，增加盈利能力，实现精准营销，

2017-05-01

734

Data Serialization 数据序列化，对于任意分布式系统都是性能的关键点 Spark默认使用Java serialization，这个比较低效推荐使用，Kryo serialization，会比Java序列化，更快更小， Spark使用Twitter chilllibrary（Kryo的scala扩展） conf.set("spark.serializer", "org.apache.spark.serializer.KryoSerializer") conf.set("spark.kryoserializer.buffer.mb“, 2), 需要大于最大的需要序列化的对象size 之所以，spark不默认使用Kryo，因为Kryo需要显式的注册program中使用到的class，参考 val conf = new SparkConf().setMaster(...).setAppName(...) conf.registerKryoClasses(Array(classOf[MyClass1], classOf[MyClass2])) val sc = new Spar...

2017-05-01

701

资源下载

更多资源

Spring

Spring框架（Spring Framework）是由Rod Johnson于2002年提出的开源Java企业级应用框架，旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念，提供核心容器、应用上下文、数据访问集成等模块，支持整合Hibernate、Struts等第三方框架，其适用范围不仅限于服务器端开发，绝大多数Java应用均可从中受益。

Rocky Linux

Rocky Linux（中文名：洛基）是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版，作为CentOS稳定版停止维护后与RHEL（Red Hat Enterprise Linux）完全兼容的开源替代方案，由社区拥有并管理，支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性，采用模块化包装和SELinux安全架构，默认包含GNOME桌面环境及XFS文件系统，支持十年生命周期更新。

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能，例如代码缩略图，Python的插件，代码段等。还可自定义键绑定，菜单和工具栏。Sublime Text 的主要功能包括：拼写检查，书签，完整的 Python API ， Goto 功能，即时项目切换，多选择，多窗口等等。Sublime Text 是一个跨平台的编辑器，同时支持Windows、Linux、Mac OS X等操作系统。

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源，继承了IntelliJ IDEA强大的JS部分的功能。