Scala IDE for Eclipse的下载、安装和WordCount的初步使用（本地模式和集群模式）

2017-11-13 568

本博文包括：

　　Scala IDE for Eclipse的下载

　　 Scala IDE for Eclipse的安装

　　本地模式或集群模式

　　我们知道，对于开发而言，IDE是有很多个选择的版本。如我们大部分人经常用的是如下。

Eclipse *版本

Eclipse *下载

　　而我们知道，对于spark的scala开发啊，有为其专门设计的eclipse，Scala IDE for Eclipse。

1、Scala IDE for Eclipse的下载

http://scala-ide.org/

2、Scala IDE for Eclipse的安装

进行解压

3、Scala IDE for Eclipse的WordCount的初步使用

在这之前，先在本地里安装好java和scala

　　因为，我这篇博客，是面向基础的博友而分享的。所以，在此，是在Scala IDE for Eclipse里，手动新建scala项目。

注意：推荐使用IDEA ，当然有人肯定还依依不舍Scala IDE for Eclipse。

则，如下是我写的另一篇博客

Scala IDEA for Eclipse里用maven来创建scala和java项目代码环境（图文详解）

默认竟然变成了scala 2.11.8去了

这一定要换！

Scala2.11.8（默认的版本） --------> scala2.10.4（我们的版本）

第一步：修改依赖的scala版本，从scala2.11.*，至scala2.10.*。

这里是兼容版本，没问题。Scala2.10.6和我们的scala2.10.4没关系！！！

第二步：加入spark的jar文件依赖

http://spark.apache.org/downloads.html

我这里，以spark-1.5.2-bin-hadoop2.6.tgz为例，其他版本都是类似的，很简单！

http://www.apache.org/dyn/closer.lua/spark/spark-1.5.2/spark-1.5.2-bin-hadoop2.6.tgz

第三步：找到spark依赖的jar文件，并导入到Scala IDE for Eclipse的jar依赖中

添加Spark的jar依赖spark-1.5.2-bin-hadoop2.6.tgz里的lib目录下的spark-assembly-1.5.2-hadoop2.6.0.jar

第四步：在src下，建立spark工程包

第五步：创建scala入口类

定义main方法

第六步:把class变成object，并编写main入口方法。

本地模式

第1步

第2步

第3步

第4步

第5步

第6步

集群模式

　　这里，学会巧，复制粘贴，WordCount.scala 为 WordCount_Clutser.scala。

现在呢，来从Linux里，拷贝文件到hadoop集群里

即，将

/usr/local/spark/spark-1.5.2-bin-hadoop2.6/README.md 到 / 或 hdfs://SparkSingleNode:9000

spark@SparkSingleNode:/usr/local/hadoop/hadoop-2.6.0$ pwd
/usr/local/hadoop/hadoop-2.6.0
spark@SparkSingleNode:/usr/local/hadoop/hadoop-2.6.0$ bin/hadoop fs -copyFromLocal /usr/local/spark/spark-1.5.2-bin-hadoop2.6/README.md hdfs://SparkSingleNode:9000/
spark@SparkSingleNode:/usr/local/hadoop/hadoop-2.6.0$ bin/hadoop fs -ls /
Found 2 items
-rw-r--r-- 1 spark supergroup 3593 2016-09-18 10:15 /README.md
drwx-wx-wx - spark supergroup 0 2016-09-09 16:28 /tmp
spark@SparkSingleNode:/usr/local/hadoop/hadoop-2.6.0$

// val lines:RDD[String] = sc.textFile("D://SoftWare//spark-1.6.2-bin-hadoop2.6//README.md", 1)//path指的是文件路径，minPartitions指的是最小并行度
// val lines = sc.textFile("D://SoftWare//spark-1.6.2-bin-hadoop2.6//README.md", 1)//path指的是文件路径，minPartitions指的是最小并行度
// val lines = sc.textFile("hdfs://SparkSingleNode:9000/README.md", 1)//没必要会感知上下文
// val lines = sc.textFile("/README.md", 1)//path指的是文件路径，minPartitions指的是最小并行度
val lines = sc.textFile("/README.md")//为什么，这里不写并行度了呢？因为,hdfs会有一个默认的

如，我们的这里/里，有188个文件，每个文件小于128M。

所以，会有128个小集合。

当然，若是大于的话，我们可以人为干预，如3等

做好程序修改之后，

我这里啊，遇到如上的错误。

http://blog.csdn.net/weipanp/article/details/42713121

(3)Exception in thread "main" java.lang.UnsatisfiedLinkError: org.apache.hadoop.util.NativeCrc32.nativeComputeChunkedSumsByteArray(II[BI[BIILjava/lang/String;JZ)V

at org.apache.hadoop.util.NativeCrc32.nativeComputeChunkedSumsByteArray(Native Method)

修复方法：在hadoop2.6源码里找到NativeCrc32.java，创建与源码一样的包名，拷贝NativeCrc32.java到该包工程目录下。

hadoop-2.6.0-src/hadoop-common-project/hadoop-common/src/main/java/org/apache/hadoop/util/NativeCrc32.java

以及，缺少hadoop.dll，注意是64位的。放到hadoop-2.6.0下的bin目录下

玩玩spark-1.5.2-bin-hadoop2.6.tgz

继续，，，出现了一些问题！

其实啊，在集群里，模板就是如下

val file = spark.textFile("hdfs://...”)

val counts = file.flatMap("line => line.spilt(" "))

　　　　　　　　.map(word => (word,1))

　　　　　　　　.reduceByKey(_+_)

　counts.saveAsTextFile("hdfs://...”)

本文转自大数据躺过的坑博客园博客，原文链接：http://www.cnblogs.com/zlslch/p/5880006.html，如需转载请自行联系原作者

微信关注我们

原文链接：https://yq.aliyun.com/articles/371052

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

eclipse下提交job时报错mapred.JobClient: No job jar file set. User classes ma...

windows下，连接远程集群，直接在eclipse里运行mapreduce作业时，错误信息： 11/10/14 13:52:07 WARN mapred.JobClient: Use GenericOptionsParser for parsing the arguments. Applications should implement Tool for the same.11/10/14 13:52:07 WARN mapred.JobClient: No job jar file set. User classes may not be found. See JobConf(Class) or JobConf#setJar(String).11/10/14 13:52:07 INFO input.FileInputFormat: Total input paths to process : 511/10/14 13:52:07 INFO mapred.JobClient: Running job: job_201110141041_001411/10/14 13:52:08 I...

2017-11-14

512

MapReduce应该算是MongoDB操作中比较复杂的了，自己开始理解的时候还是动了动脑子的，所以记录在此！命令语法：详细看 db.runCommand( { mapreduce : 字符串，集合名, map : 函数,见下文 reduce : 函数，见下文 [, query : 文档，发往map函数前先给过渡文档] [, sort : 文档，发往map函数前先给文档排序] [, limit : 整数，发往map函数的文档数量上限] [, out : 字符串，统计结果保存的集合] [, keeptemp: 布尔值，链接关闭时临时结果集合是否保存] [, finalize : 函数，将reduce的结果送给这个函数，做最后的处理] [, scope : 文档,js代码中要用到的变量] [, jsMode : 布尔值，是否减少执行过程中BSON和JS的转换，默认 true ] //注：false时 BSON-->JS-->map-->BSON-->JS-->reduce-->BSON,可处理非常大的mapreduce,<b...

2017-11-14

603

资源下载

更多资源

优质分享App

近一个月的开发和优化，本站点的第一个app全新上线。该app采用极致压缩，本体才4.36MB。系统里面做了大量数据访问、缓存优化。方便用户在手机上查看文章。后续会推出HarmonyOS的适配版本。

Nacos

Nacos /nɑ:kəʊs/ 是 Dynamic Naming and Configuration Service 的首字母简称，一个易于构建 AI Agent 应用的动态服务发现、配置管理和AI智能体管理平台。Nacos 致力于帮助您发现、配置和管理微服务及AI智能体应用。Nacos 提供了一组简单易用的特性集，帮助您快速实现动态服务发现、服务配置、服务元数据、流量管理。Nacos 帮助您更敏捷和容易地构建、交付和管理微服务平台。

Spring

Spring框架（Spring Framework）是由Rod Johnson于2002年提出的开源Java企业级应用框架，旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念，提供核心容器、应用上下文、数据访问集成等模块，支持整合Hibernate、Struts等第三方框架，其适用范围不仅限于服务器端开发，绝大多数Java应用均可从中受益。

Rocky Linux

Rocky Linux（中文名：洛基）是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版，作为CentOS稳定版停止维护后与RHEL（Red Hat Enterprise Linux）完全兼容的开源替代方案，由社区拥有并管理，支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性，采用模块化包装和SELinux安全架构，默认包含GNOME桌面环境及XFS文件系统，支持十年生命周期更新。

Scala IDE for Eclipse的下载、安装和WordCount的初步使用（本地模式和集群模式）

Scala IDEA for Eclipse里用maven来创建scala和java项目代码环境（图文详解）

eclipse下提交job时报错mapred.JobClient: No job jar file set. User classes ma...

MongoDB MapReduce

相关文章

发表评论

资源下载

优质分享App

Nacos

Spring

Rocky Linux

欢迎您来访！