Hive Tuning(三) 从查询计划看hive.auto.convert.join的好处-低调大师

Hive Tuning(三) 从查询计划看hive.auto.convert.join的好处

2016-09-07 841

今天我们来讲一下如何看懂Hive的查询计划。

hive的执行计划包括三部分:

– Abstract syntax tree – 可以直接忽略

– Stage dependencies – 依赖

– Stage plans – hive如何执行任务的信息。

e8bc385635b48c30eda02e23b450e30c2e29cbe0

下面还是以一个案例作为说明

8f513921972ef28a83fba0eb5f77d1cec820ceb1

设置自动连接为false的话，要走5步。

537d4630adcd877247be8419c935c61aeeb64240

4 Map Reduces tells you something is not right.

Stage: Stage-1

Map Reduce

Stage: Stage-2

Map Reduce

Stage: Stage-3

Map Reduce

Stage: Stage-4

Map Reduce

设置自动连接为true就只有4步

e24c3d142387fc4a2ec58402d38979d980ba1aee

Only 2 Map Reduces

Stage: Stage-8

Map Reduce

Stage: Stage-4

Map Reduce

7f873296b36f19fd5c148a61dd7711f80df55d0d

hive直接就加载了要做连接的表，client和path表，其中client表做了过滤，剩下的map/reduce是用来连接和排序的。

微信关注我们

原文链接：https://yq.aliyun.com/articles/60185

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

Spark Tungsten-sort Based Shuffle 分析

前言看这篇文章前，建议你先简单看看 Spark Sort Based Shuffle内存分析。 Tungsten 中文是钨丝的意思。 Tungsten Project 是 Databricks 公司提出的对Spark优化内存和CPU使用的计划，该计划初期似乎对Spark SQL优化的最多。不过部分RDD API 还有Shuffle也因此受益。简述 Tungsten-sort优化点主要在三个方面: 直接在serialized binary data上sort而不是java objects，减少了memory的开销和GC的overhead。提供cache-efficient sorter，使用一个8bytes的指针，把排序转化成了一个指针数组的排序。 spill的merge过程也无需反序列化即可完成这些优化的实现导致引入了一个新的内存管理模型，类似OS的Page，对应的实际数据结构为MemoryBlock,支持off-heap 以及 in-heap 两种模式。为了能够对Record 在这些MemoryBlock进行定位，引入了Pointer（指针）的概念。如果你还记得Sort B...

2016-09-07

653

看《Hadoop：权威指南》的时候收集了书上写的一些需要优化的参数，记录了一下子，给大家分享一下吧。 1.mapred.task.timeout 任务超时时间，默认是10分钟 2.mapred.map.max.attempts mapred.reduce.max.attempts 默认任务失败重复次数为4 3.mapred.max.map.failures.percent mapred.reduce.map.failures.percent 不触发错误的失败的最大百分比 4.mapred.jobtracker.taskScheduler 作业调度算法设置,默认是FIFO 5.io.sort.mb io.sort.spill.percent 缓冲区大小默认为100MB，以及缓冲区阀值默认为0.8，超过80%就保存到硬盘 6.io.sort.factor 默认为10，一次只能合并10个溢出文件 7.mapred.compress.map.output 默认为false，不压缩输出文件压缩算法由mapred.map.output.compression.codec指定 8.tracker....

2016-09-07

969

资源下载

更多资源

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长，特征是大鼻子、头戴帽子、身穿背带裤，还留着胡子。与他的双胞胎兄弟路易基一起，长年担任任天堂的招牌角色。

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题，腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构，目前腾讯云软件源站支持公网访问和内网访问。

Rocky Linux

Rocky Linux（中文名：洛基）是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版，作为CentOS稳定版停止维护后与RHEL（Red Hat Enterprise Linux）完全兼容的开源替代方案，由社区拥有并管理，支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性，采用模块化包装和SELinux安全架构，默认包含GNOME桌面环境及XFS文件系统，支持十年生命周期更新。

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能，例如代码缩略图，Python的插件，代码段等。还可自定义键绑定，菜单和工具栏。Sublime Text 的主要功能包括：拼写检查，书签，完整的 Python API ， Goto 功能，即时项目切换，多选择，多窗口等等。Sublime Text 是一个跨平台的编辑器，同时支持Windows、Linux、Mac OS X等操作系统。