Hive Tuning(三) 从查询计划看hive.auto.convert.join的好处

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。
持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。
转载内容版权归作者及来源网站所有,本站原创内容转载请注明来源。
- 上一篇
Spark Tungsten-sort Based Shuffle 分析
前言 看这篇文章前,建议你先简单看看 Spark Sort Based Shuffle内存分析。 Tungsten 中文是钨丝的意思。 Tungsten Project 是 Databricks 公司提出的对Spark优化内存和CPU使用的计划,该计划初期似乎对Spark SQL优化的最多。不过部分RDD API 还有Shuffle也因此受益。 简述 Tungsten-sort优化点主要在三个方面: 直接在serialized binary data上sort而不是java objects,减少了memory的开销和GC的overhead。 提供cache-efficient sorter,使用一个8bytes的指针,把排序转化成了一个指针数组的排序。 spill的merge过程也无需反序列化即可完成 这些优化的实现导致引入了一个新的内存管理模型,类似OS的Page,对应的实际数据结构为MemoryBlock,支持off-heap 以及 in-heap 两种模式。为了能够对Record 在这些MemoryBlock进行定位,引入了Pointer(指针)的概念。 如果你还记得Sort B...
- 下一篇
hadoop 参数
看《Hadoop:权威指南》的时候收集了书上写的一些需要优化的参数,记录了一下子,给大家分享一下吧。 1.mapred.task.timeout 任务超时时间,默认是10分钟 2.mapred.map.max.attempts mapred.reduce.max.attempts 默认任务失败重复次数为4 3.mapred.max.map.failures.percent mapred.reduce.map.failures.percent 不触发错误的失败的最大百分比 4.mapred.jobtracker.taskScheduler 作业调度算法设置,默认是FIFO 5.io.sort.mb io.sort.spill.percent 缓冲区大小默认为100MB,以及缓冲区阀值默认为0.8,超过80%就保存到硬盘 6.io.sort.factor 默认为10,一次只能合并10个溢出文件 7.mapred.compress.map.output 默认为false,不压缩输出文件 压缩算法由mapred.map.output.compression.codec指定 8.tracker....
相关文章
文章评论
共有0条评论来说两句吧...
文章二维码
点击排行
推荐阅读
最新文章
- Docker安装Oracle12C,快速搭建Oracle学习环境
- CentOS6,CentOS7官方镜像安装Oracle11G
- CentOS7设置SWAP分区,小内存服务器的救世主
- Docker使用Oracle官方镜像安装(12C,18C,19C)
- SpringBoot2全家桶,快速入门学习开发网站教程
- CentOS7安装Docker,走上虚拟化容器引擎之路
- CentOS7编译安装Gcc9.2.0,解决mysql等软件编译问题
- Docker快速安装Oracle11G,搭建oracle11g学习环境
- CentOS7编译安装Cmake3.16.3,解决mysql等软件编译问题
- Jdk安装(Linux,MacOS,Windows),包含三大操作系统的最全安装