带你掌握数仓的作业级监控TopSQL-低调大师

带你掌握数仓的作业级监控TopSQL

2023-04-20 865

摘要：目前TopSQL功能被用户广泛使用，是性能定位、劣化分析、审计回溯等重要的基石，为用户提供覆盖内存、耗时、IO、网络、空间等多方面的监控能力。

本文分享自华为云社区《GaussDB(DWS)监控工具指南（一）作业级监控TopSQL》，作者：幕后小黑爪。

1、引言：

监控系统是智能化管理和自动化运维的基石，可以为资源规划，故障排查，性能优化提供至关重要的数据支持。GaussDB(DWS)作为企业级数仓，为用户提供了一整套覆盖实例级、用户级、作业级的资源监控能力，其中，作业级监控（下文统称为TopSQL）主要是对运行作业的监控，包括了实时运行作业的相关信息，历史运行作业的相关信息等。它收集的数据来源于数据库内部，为用户提供了实时监控数据库的能力。

目前TopSQL功能被用户广泛使用，是性能定位、劣化分析、审计回溯等重要的基石，为用户提供覆盖内存、耗时、IO、网络、空间等多方面的监控能力。

本文以数仓813版本作为基线，对TopSQL进行介绍。

2、TopSQL功能介绍

对于用户而言，数据库是个黑盒，输入SQL语句，输出预期结果。在此过程中，用户关心两点：

输出结果是否符合预期;
语句要多久跑完。

关于第一个问题，用户需要关注下SQL语句写的是否合理。而对于第二个问题，普通用户可以通过explain等手段分析作业的执行计划，然而企业用户的SQL作业耗时久，影响较大，重跑代价较高，无法额外通过explain performance等手段进行分析，此时TopSQL可以帮助用户打开数据库黑盒，查看作业执行的实时情况和历史情况，便于用户分析数据库的情况。

TopSQL功能主要通过视图进行承载，如下表所示，本文以query级别的视图为例进行说明。

使用TopSQL功能需要sysadmin权限。此外，用户需先检查下TopSQL功能是否开启，涉及TopSQL的数据库GUC参数包括：

ENABLE_RESOURCE_TRACK (ON)

是否开启监控功能，实时TopSQL的总开关，关闭之后实时TopSQL将不再进行记录，更不会在历史TopSQL中出现。

RESOURCE_TRACK_COST(0)

设置对当前会话的语句进行资源监控的最小执行代价。

RESOURCE_TRACK_LEVEL(QUERY)

设置当前会话的资源监控的等级，默认为query级别。

RESOURCE_TRACK_DURATION(60S)

设置实时TopSQL中记录的语句执行结束后进行历史信息转存的最小执行时间。当执行完成的作业，其执行时间不小于此参数值时，作业信息会从实时视图（以STATISTICS为后缀的视图）转存到相应的历史视图

ENABLE_RESOURCE_RECORD(ON)

设置是否开启资源监控记录归档功能。开启时，对于执行结束的记录，会分别被归档到相应的INFO视图，CN和DN都需要设置上。

TOPSQL_RETENTION_TIME(30)

设置历史TopSQL中GS_WLM_SESSION_INFO和GS_WLM_OPERATOR_INFO表中数据的保存时间，单位为天。

参数正确设置后，TopSQL会记录用户的SQL语句执行过程中的相关信息，用户可以使用TopSQL的视图筛选出执行时间较长的作业，专注于慢SQL的分析。

TopSQL功能分为实时TopSQL和历史TopSQL，以query级别为例，当需要查看正在运行的作业时，用户可查看实时TopSQL视图GS_WLM_SESSION_STATISTICS和PGXC_WLM_SESSION_STATISTICS，若需要对已经执行完成的作业进行分析，可查询历史TopSQL视图GS_WLM_SESSION_ HISTORY和PGXC_WLM_SESSION_ HISTORY。其中GS_开头的可以查询当前CN节点上正在执行的作业信息，PGXC_开头的可查询所有CN节点上正在执行的作业信息。

实时TopSQL视图为用户记录了作业运行时的相关信息，比如作业下发来源、阻塞时间、执行时长、开始时间、内存消耗、作业下盘量、作业IO、网络、语句类型、语句的执行计划等信息。用户可先通过resource_pool、nodename、username、query等信息定位到自己需要分析的语句，再通过作业运行信息定位问题。又或者用户可通过对查询进行筛选，筛选出当前占用资源较多的作业。

历史TopSQL视图记录了作业运行结束时的资源使用情况(包括内存、下盘、CPU时间等)和运行状态信息(包括报错、终止、异常等)以及性能告警信息。用户可通过对历史语句运行数据的分析，筛选出执行时长较大的语句，看语句执行计划是否有优化的空间，是否需要对表做一些analyze或者vacuum之类的操作。又比如对于内存报错的情况，可分析内存占用高的语句是否合理，从执行计划上分析是否有优化空间。

文末附TopSQL实践：常见问题现象及对应原因。

3、TopSQL的原理解析

3.1 TopSQL原理简介：

TopSQL的数据来源于数据库内核，当语句执行时，TopSQL会实时记录语句执行的相关信息。实时TopSQL数据会保存在内存的临时表中，当语句执行结束后，数据会转存到对应实体表GS_WLM_SESSION_INFO中，在实际使用中，由于下发作业繁多，历史TopSQL记录的作业数也不断增长，这样会导致INFO表中的数据量逐渐庞大，为了确保数仓整体性能不受影响，支持通过TOPSQL_RETENTION_TIME来设置INFO表中数据的保存时间（单位为天）。当数据存留时长超过这个时限，会对实体表GS_WLM_SESSION_INFO进行数据老化删除处理。

图 3-1 TopSQL数据流通图

如图3-1所示，各项GUC参数决定了TopSQL生成的记录信息，具体的参数说明详见第2节使用TopSQL前的检验。

3.2 性能分析：

对于企业用户而言，性能问题是Top级问题，对于TopSQL功能，我们进行了性能压测，在4TB的场景下，进行TPCC基准性能测试，进行了2000的并发压测，TPMC下降了约有2%，属于可接受的范围。

3.3 相关指标

语句属性列说明：

语句的执行信息属性列,斜体代表可更换前缀/后缀式的指标，类似前缀后缀有（min_，max_，total_，average_，_skew_percent）

3.4 特殊情况说明：

TopSQL由于自身限制，存在一些记录异常的情况，此处对8.1.3版本的TopSQL语句记录情况进行说明：

不记录特殊数据定义语句，如：SET、RESET、SHOW、ALTER SESSION SET、SET CONSTRAINTS语句；
记录数据定义语句，例如：执行CREATE、ALTER、DROP、GRANT、REVOKE和VACUUM语句；
记录数据操作语句，例如：
1. 执行SELECT、INSERT、UPDATE和DELETE语句。
2. 执行explain analyze和explain performance场景。
3. 执行查询query级别/perf级别视图
ODBC下发作业，由于多语句原因，会记录事务的BEGIN和end语句；
JDBC下发作业，随机性多记录一条JDBC的内部语句
解析错误和语法报错的异常不记录
用户手动CANCEL作业，显示的监控数据可能为0；
当子语句开关打开后，只会记录下发到DN上执行的子语句；
游标语句，当游标并非从缓存中读取数据，而确实触发语句下发到DN上执行的条件下，该游标语句会被记录，并且会进行语句、执行计划增强，但当游标从缓存中读取数据时，不进行记录；当游标语句在匿名块或者函数中使用时，当游标从DN上读取较多数据但不完全使用时，无法记录该游标在DN上的监控信息。
JDBC执行的带占位符语句，通常会补齐参数内容，但如果参数和原语句合起来长度超过64KB，则不记录参数，或者如果是轻量化语句，直接下发到DN上执行，不记录参数。

4、TopSQL扩展及应用

TopSQL功能是GaussDB(DWS)支持性能问题定位、语句劣化分析、审计回溯等重要功能的基石。在此基础上，内核也拓展出了异常规则等一些高阶用法，在日常使用中，用户也对TopSQL提出了更高的要求，比如记录子语句、记录语句类型、提升算子级别语句监控准确性等诸多建议。为此，GaussDB（DWS）团队会在此基础上继续演进，更好的服务用户，提升用户满意度。

5、TopSQL实践：常见问题定位

总结一下：

因数据量变化，导致作业执行时间增加，可以分析A2/B1/D1/G1，进而确认作业查询的数据表是否有明显的数据量增加；
因其它并发作业抢占，导致作业排队，从而导致作业执行时间增加，可以分析A1/B1/D1，进而查看作业执行的同时期是否有大量并发作业在执行；
因其它作业而产生的CPU抢占，导致作业执行时间增加，可以分析A2/D1/E1，进而查看作业执行的同时期是否有大量并发作业在执行；
因其它作业而产生的IO抢占，导致作业执行时间增加，可以分析A2/F1，进而查看作业执行的同时期是否有大量并发作业在执行；
I1中有结果情况，可通过提示的信息进行分析，或者进行SQL自适应诊断相关告警处理，SQL自适应诊断处理方法见：https://support.huaweicloud.com/performance-dws/dws_10_0013.html
对于enqueue异常排队的情况H1，用户可参考：GaussDB(DWS)资源管理排队原理与问题定位-云社区-华为云 (huaweicloud.com)，进行问题排查分析。

值得注意的是，发生资源争抢时，可能会出现并发症，即CPU、IO抢占，作业排队现象都会发生，针对并发症问题，可以逐步分析解决，比如：

第一步，调整作业执行顺序，减少并发作业数量，减少阻塞时间；

第二步，定位出同时段执行的典型计算密集型、存储密集型作业，先移动到其它时间段执行，减少对本作业的影响；

第三步，在无其他作业明显干预的情况下，做进一步分析，

6、参考文献：

点击关注，第一时间了解华为云新鲜技术~

微信关注我们

原文链接：https://my.oschina.net/u/4526289/blog/8676884

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

详解数据结构中栈的定义和操作

摘要：本文为大家详解数据结构中栈的定义和操作。本文分享自华为云社区《数据结构：详细讲解栈的定义、栈的操作》，作者：高彬滔。 1.栈的定义栈（stack）：是只允许在一端进行插入或者删除操作的线性表（即后进先出，大概可以理解为吃饱了吐出来）空栈：不含元素的空标配栈顶：表尾端栈底：表头端进栈顺序：a1->a2->a3->a4->a5 出栈顺序：a5->a4-a3->a2->a1 2.对比线性表和栈基本操作 2.1 线性表的基本操作 InitList(&L):初始化表。构造一个空的线性表L，分配内存空间 DestoryList(&L):销毁操作。销毁线性表，并且释放线性表L所占用的空间 ListInsert(&L,i,e):插入操作，在表L中的第i个位置上插入指定元素e ListDelete(&L,i,e):删除操作，删除表L中的第i个位置的元素，并且用e返回删除元素的值 LocateElem(L,e):按值查找操作，在表L中查找具有给定关键字值的元素 GetElem(L,i):按位查找操作，获取表L中...

2023-04-20

1110

传统APM聚焦在代码层面，不具备全栈多维度无盲点看问题的能力，同时由于插码的阻碍往往难以覆盖所有微服务，DeepFlow依靠eBPF零代码修改采集全栈追踪数据并聚合生成了调用关系，可以增强传统APM的数据，大大缩短问题定界时间。对于已经使用传统APM工具的用户，可以考虑使用DeepFlow提供的API来增强应用依赖拓扑及调用追踪，以获得全栈数据追踪能力。本文以SkyWalking为例从落地实现角度来描述，如何将在传统APM中集成DeepFlow的数据，增强传统APM数据能力，主要从以下两个角度来：依赖拓扑：增强查看某历史时间范围内服务（POD）到服务（POD）全栈路径拓扑以及全景上下游拓扑。调用链追踪：增强查看某个应用Span对应系统Span、网络Span时延消耗以及追踪未插码服务的能力。开启下文的阅读之前，需要对DeepFlow目前已有的数据及术语有了解，下文默认读者都有一定的认知。如果对 DeepFlow、eBPF、OpenCloudOS开源社区感兴趣，欢迎预约4月26日的线上直播《eBPF 技术落地实战：从可移植性到性能开销》，扫描下方二维码报名！ 01｜全栈路径拓扑-...

2023-04-20

990

资源下载

更多资源

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长，特征是大鼻子、头戴帽子、身穿背带裤，还留着胡子。与他的双胞胎兄弟路易基一起，长年担任任天堂的招牌角色。

Spring

Spring框架（Spring Framework）是由Rod Johnson于2002年提出的开源Java企业级应用框架，旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念，提供核心容器、应用上下文、数据访问集成等模块，支持整合Hibernate、Struts等第三方框架，其适用范围不仅限于服务器端开发，绝大多数Java应用均可从中受益。

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能，例如代码缩略图，Python的插件，代码段等。还可自定义键绑定，菜单和工具栏。Sublime Text 的主要功能包括：拼写检查，书签，完整的 Python API ， Goto 功能，即时项目切换，多选择，多窗口等等。Sublime Text 是一个跨平台的编辑器，同时支持Windows、Linux、Mac OS X等操作系统。

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源，继承了IntelliJ IDEA强大的JS部分的功能。