首页 文章 精选 留言 我的

精选列表

搜索[mapreduce],共3589篇文章
优秀的个人博客,低调大师

【问题】spark运行python写的mapreduce任务,hadoop平台报错,java.net.ConnectException: 连...

问题: 用spark-submit以yarn-client方式提交任务,在集群的某些节点上的任务出现连接超时的错误,排查过各种情况后,确定在防火墙配置上出现问题。 原因: 我猜测是python程序启动后,作为Server,hadoop中资源调度是以java程序作为Client端访问, Python启动的Server端需要接受localhost的client访问。 当你从一台linux主机向自身发送数据包时,实际上的数据包是通过虚拟的lo接口来发送接受的,而不会通过你的物理网卡 eth0/eth1....,此时防火墙就要允许来自本地lo接口的数据包,需要加入以下配置允许Python Server接受来自本地lo接口的数据包,然后解决该问题。 1 iptables-AINPUT-ilo-jACCEPT添加iptables规则,允许来自于lo接口的数据包 任务的部分报错日志 16/07/2513:56:44INFOlzo.LzoCodec:Successfullyloaded&initializednative-lzolibrary[hadoop-lzorevd62701d4d05dfa6115bbaf8d9dff002df142e62d] 16/07/2513:56:44INFOConfiguration.deprecation:mapred.tip.idisdeprecated.Instead,usemapreduce.task.id 16/07/2513:56:44INFOConfiguration.deprecation:mapred.task.idisdeprecated.Instead,usemapreduce.task.attempt.id 16/07/2513:56:44INFOConfiguration.deprecation:mapred.task.is.mapisdeprecated.Instead,usemapreduce.task.ismap 16/07/2513:56:44INFOConfiguration.deprecation:mapred.task.partitionisdeprecated.Instead,usemapreduce.task.partition 16/07/2513:56:44INFOConfiguration.deprecation:mapred.job.idisdeprecated.Instead,usemapreduce.job.id 16/07/2513:57:47WARNpython.PythonWorkerFactory:FailedtoopensockettoPythondaemon: java.net.ConnectException:连接超时 atjava.net.PlainSocketImpl.socketConnect(NativeMethod) atjava.net.AbstractPlainSocketImpl.doConnect(AbstractPlainSocketImpl.java:339) atjava.net.AbstractPlainSocketImpl.connectToAddress(AbstractPlainSocketImpl.java:200) atjava.net.AbstractPlainSocketImpl.connect(AbstractPlainSocketImpl.java:182) atjava.net.SocksSocketImpl.connect(SocksSocketImpl.java:392) atjava.net.Socket.connect(Socket.java:579) atjava.net.Socket.connect(Socket.java:528) atjava.net.Socket.<init>(Socket.java:425) atjava.net.Socket.<init>(Socket.java:241) atorg.apache.spark.api.python.PythonWorkerFactory.createSocket$1(PythonWorkerFactory.scala:75) atorg.apache.spark.api.python.PythonWorkerFactory.liftedTree1$1(PythonWorkerFactory.scala:90) atorg.apache.spark.api.python.PythonWorkerFactory.createThroughDaemon(PythonWorkerFactory.scala:89) atorg.apache.spark.api.python.PythonWorkerFactory.create(PythonWorkerFactory.scala:62) atorg.apache.spark.SparkEnv.createPythonWorker(SparkEnv.scala:135) atorg.apache.spark.api.python.PythonRunner.compute(PythonRDD.scala:101) atorg.apache.spark.api.python.PythonRDD.compute(PythonRDD.scala:70) atorg.apache.spark.rdd.RDD.computeOrReadCheckpoint(RDD.scala:297) atorg.apache.spark.rdd.RDD.iterator(RDD.scala:264) atorg.apache.spark.api.python.PairwiseRDD.compute(PythonRDD.scala:342) atorg.apache.spark.rdd.RDD.computeOrReadCheckpoint(RDD.scala:297) atorg.apache.spark.rdd.RDD.iterator(RDD.scala:264) atorg.apache.spark.scheduler.ShuffleMapTask.runTask(ShuffleMapTask.scala:73) atorg.apache.spark.scheduler.ShuffleMapTask.runTask(ShuffleMapTask.scala:41) atorg.apache.spark.scheduler.Task.run(Task.scala:88) atorg.apache.spark.executor.Executor$TaskRunner.run(Executor.scala:214) atjava.util.concurrent.ThreadPoolExecutor.runWorker(ThreadPoolExecutor.java:1145) atjava.util.concurrent.ThreadPoolExecutor$Worker.run(ThreadPoolExecutor.java:615) atjava.lang.Thread.run(Thread.java:745) 16/07/2513:57:47WARNpython.PythonWorkerFactory:Assumingthatdaemonunexpectedlyquit,attemptingtorestart 16/07/2513:58:51ERRORexecutor.Executor:Exceptionintask0.0instage0.0(TID0) 参考地址: http://stackoverflow.com/questions/15659132/connection-refused-between-a-python-server-and-a-java-client http://stackoverflow.com/questions/26297551/connecting-python-and-java-via-sockets/38605208#38605208 http://www.zybang.com/question/9ab66451988eb2768194817f25a0b7a9.html 本文转自巧克力黒 51CTO博客,原文链接:http://blog.51cto.com/10120275/1830831,如需转载请自行联系原作者

优秀的个人博客,低调大师

基于大数据开发套件定时调度带资源文件的MapReduce作业

MaxCompute里的MR作业,很少是只要跑一次就好了的。如果需要周期性调度,目前MaxCompute(原名ODPS)只提供了计算引擎,任务调度可以使用大数据开发套件来实现。这篇帖子从基础开始,介绍了3种周期性调度的方法。同时还介绍了如何使用资源文件。 代码开发 代码以文档里的WordCount 作为例子。在这个基础上,增加资源文件的读取方法,修改Reduce类。主要的逻辑是读取资源文件,资源文件里的数据格式是字符串1,字符串2。代码逻辑是如果word count里的word如果有在字符串1里出现的话,就替换成字符串2。 public static class SumReducer extends ReducerBase { private Record result = null; priva

优秀的个人博客,低调大师

Hadoop MapReduce概念学习系列之MyEclipse和Hadoop上都出现中文乱码问题(二十四)

出现中文乱码问题情况,详细如下! 在MyEclipse里 在Hadoop里 那么,如果是这样情况,说明是要改编码。 解决的办法? 1 、windows -> preferences 2、将Text file encoding的other部分,改为UTF-8。 3、hadoop项目,右键,prpperties,然后出现以下界面。就是配置好了,即hadoop项目的消除中文乱码问题解决。 将Inherited from container(UTF-8)的Other改为UTF-8。 4、刷新,重新即可。将之前的salary.txt重新上传。 即,本地的MyEclipse中已经解决了乱码问题。 5、现在,需要到hadoop集群上去成功运行,这该怎么做呢? Hadoop -> Export -> Export, Java -> JAR file -> next 6、 因为,在hadoop里,这些依赖的架包是存在的,所以我们就不需要再多此一举再打包了。 为架包取一个名称,为SalaryCount.jar,先在D盘新建文件夹JAR,存放在D:\JAR\SalaryCount.jar 在D盘的JAR目录下,查看sc.jar 7、接下来,用xshell来连接CentOS6.5。 8、rz,打开D:\JAR\sc.jar ,上传至CentOS6.5 9、通过rz命令上传sc.jar包 10、 执行命令 hadoop jar sc.jarcom.dajiangtai.hadoop.test.SalaryCount /salary/ /salary/out/ 11 查看结果 hadoop fs -text /salary/out/part-r-00000 即,与在本地的MyEclipse的结果是一样的。 本文转自大数据躺过的坑博客园博客,原文链接:http://www.cnblogs.com/zlslch/p/5077864.html,如需转载请自行联系原作者

资源下载

更多资源
Mario

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长,特征是大鼻子、头戴帽子、身穿背带裤,还留着胡子。与他的双胞胎兄弟路易基一起,长年担任任天堂的招牌角色。

腾讯云软件源

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题,腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构,目前腾讯云软件源站支持公网访问和内网访问。

Nacos

Nacos

Nacos /nɑ:kəʊs/ 是 Dynamic Naming and Configuration Service 的首字母简称,一个易于构建 AI Agent 应用的动态服务发现、配置管理和AI智能体管理平台。Nacos 致力于帮助您发现、配置和管理微服务及AI智能体应用。Nacos 提供了一组简单易用的特性集,帮助您快速实现动态服务发现、服务配置、服务元数据、流量管理。Nacos 帮助您更敏捷和容易地构建、交付和管理微服务平台。

WebStorm

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源,继承了IntelliJ IDEA强大的JS部分的功能。

用户登录
用户注册