解密数仓的SQL ON ANYWHERE技术
本文分享自华为云社区《GaussDB DWS的SQL ON ANYWHERE技术解密》,作者:tooooooooooomy。
1. 前言
- 适用版本:【8.1.1(及以上)】
查询分析是大数据要解决的核心问题之一,虽然大数据相关的处理引擎组件种类繁多,并提供了丰富的接口供用户使用,但相对传统数据库用户来说,SQL语言依然是使用最简单、最广泛和方便的一种接口。如果能在一个客户端中使用SQL语句操作不同的大数据组件,将极大提升使用各种大数据组件的效率。
2. 什么是SQL On Anywhere
GaussDB(DWS)的SQL On Anywhere,主要指对大数据的文件系统和与其他异构数据库的访问和交互,构筑起统一的大数据计算平台。大数据文件系统主要包括HDFS和OBS,其他异构数据库主要包括Oracle、Spark和Other GaussDB(DWS)。
3. GaussDB(DWS)SQL On Anywhere的作用及其应用场景
通过SQL On Anywhere特性可以实现与其他大数据组件和数据库互联互通访问,可以直接同时处理本地和HDFS/OBS上的数据集,甚至其他异构数据库的数据,而无需导入导出数据,将其分析能力从本地存储扩展到数据湖中,扩大GaussDB DWS的大数据分析的应用场景;通过该特性可以帮助客户实现冷热数据分离,将使用频度更高的热数据存储在本地,而使用频度更低的冷数据存储在成本更低廉的共享存储HDFS或者DWS上,降低用户成本。
从应用场景来看,可以满足如下业务需求:
- 针对多数据源需要构建虚拟的统一数据仓库,实现多数据源联邦查询,跨数据仓库热数据和HDFS/OBS冷数据的复杂混合查询,需要提供一致的、熟悉的数据仓库操作体验。
- 满足低频的业务全数据的低成本低延迟即席查询。
4. GaussDB(DWS)SQL On Anywhere的实现方式
GaussDB(DWS)SQL On Anywhere针对大数据的文件系统的访问主要通过FDW或ELK机制(已停止演进)实现的,而跨数据库的访问主要通过EC+ODBC的方式实现的。
3.1 利用FDW访问HDFS/OBS数据
GaussDB(DWS)对存储在HDFS上的Hadoop或者OBS原生数据的访问,采用FDW(Foreign Data Wrapper)机制,也称外表机制。首先通过创建Foreign Data Server来定义对HDFS数据源或同构其他集群的连接信息;之后创建Foreign Table,用于在GaussDB A数据库内部系统表中,定义对应的HDFS数据源上Hadoop原生结构化数据表的结构或对应同构其他集群结构化数据表的结构。
例如读取hdfs上的数据,其流程如下:
1)建立一个hdfs_server,其中hdfs_fdw为数据库中存在的foreign data wrapper。
--创建hdfs_server。 postgres=# CREATE SERVER hdfs_server FOREIGN DATA WRAPPER HDFS_FDW OPTIONS (address '10.146.187.231:8000,10.180.157.130:8000' , hdfscfgpath '/opt/hadoop_client/HDFS/hadoop/etc/hadoop', type 'HDFS' ) ;
2)创建一个hdfs外表读取hdfs上的数据
CREATE FOREIGN TABLE region ( R_REGIONKEY INT4, R_NAME TEXT, R_COMMENT TEXT ) SERVER hdfs_server OPTIONS( FORMAT 'orc', FOLDERNAME '/user/hive/warehouse/mppdb.db/region_orc11_64stripe/' ) DISTRIBUTE BY roundrobin;
3)查询HDFS外表,例如:
select * from region limit 10;
目前外表支持与普通表进行关联查询,并支持多种文件存储格式,其支持的文件格式如下(不同版本能力可能存在差异,以官方文档为准):
3.2 通过ELK访问HDFS(已停止演进,不推荐)
ELK的方式类似于HAWQ,它是通过建立表空间为HDFS表空间,直接将数据存储和访问HDFS文件系统,目前只支持访问HDFS文件系统,而不支持访问OBS上的数据。首先通过创建HDFS表空间,然后会创建一个HDFS表,在创建时指定表空间为HDFS表空间,最后对HDFS表的操作如同普通表的操作,可进行插入修改删除数据。
以GaussDB数据库数据推到HDFS中
1)在数据库中创建HDFS表空间
CREATE TABLESPACE hdfs_table RELATIVE LOCATION ‘tmp/hdtest’ With (filesystem=’hdfs’, address=’28.4.136.221:9000’, cfgpath=’/opt/Huawei/bigdata/mppdb/hdfs_conf/zhndnrop/omm@HADOOP.COM/’, storepath=’/tmp/test’);
2)数据库中创建HDFS表
CREATE TABLE abc( zjxxlh char(20), nbbsh char(20), khwybh char(20), zjlx char(20) )WITH (orientation=orc) TABLESPACE tables_hdfs;
3)向表中插入数据
insert into abc select * from region10;
3.3 基于EC+ODBC的跨集群访问数据
GaussDB(DWS)支持通过 EC(全称Extension Connector)+ODBC统一访问其它大数据组件——将SQL发给其它大数据组件并接收执行结果,实现跨集群访问数据。目前EC+ODBC为用户提供了三种功能: SQL on Oracle、SQL on Spark和SQL on other GaussDB,分别用于连接Oracle数据库、Spark集群和其他GaussDB集群。
EC+ODBC的基本工作原理是:用户首先构建Data Source对象(其中包含目标库的一些连接信息和字符编码方式),然后用户获取该Data Source的使用权限,最后通过标准ODBC API连接目标库,发送SQL语句并获取执行结果。
为了方便使用,EC+ODBC为用户提供了统一的连接函数exec_on_extension(text, text)。其中,第一个参数为Data Source名称,第二个参数为发送的SQL语句,例如:
postgres=# SELECT * FROM exec_on_extension('ds_spark', 'select * from a;') AS (c1 int);
5. GaussDB(DWS) SQL On Anywhere的实现方式优缺点对比
低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。
持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。
转载内容版权归作者及来源网站所有,本站原创内容转载请注明来源。
- 上一篇
听说测试“有手就行 ”?华为20年测试老兵干货分享!
你理解的测试工程师是怎么样的?是不是觉得测试工作很简单呢? 测试简单,但也乐趣无穷 作为在华为从事大型软件系统测试工作20年的测试老兵,阿钟老师透露,20年前正是因为听信了朋友的一句“测试有手就行”, 即使不是科班出身,也自信地加入了华为测试部,从此开始了20年的测试生涯。 进入华为后,阿钟的工作内容主要是程控交换机测试,通过打各种长途电弧、国际电话、本地电话、企业内部电话,确认交换机能否正常处理呼叫业务。在阿钟看来,虽然听起来简单,但是他却能从工作中挖掘到无尽的乐趣,通过不断地解决问题,让产品越来越成熟可靠,本身就是一件很有成就感的事情。 而在后续14年里,长期从事测试工作,不仅让阿钟对测试有了全面且独特的认知,还让他成为了一个“懂产品”的测试工程师。 从“人与人”的联接到“物与物”的联接 2018年,阿钟来到了华为云IoT,他的工作内容,从测试“人与人”之间的联接,变成了“物与物”的联接。 从测试的角度来看,阿钟认为华为云IoT物联网平台有三大特点:Service On Service,海量接入,高可靠性。 所谓“Service On Service”,是指华为云IoT是构建在华为...
- 下一篇
LeetcodeJavaDebugEnhancer -- 一个用于Java的Leetcode算法题的本地调试增强器
LeetcodeJavaDebugEnhancer 🚀 一个用于Java的Leetcode算法题的本地调试增强器 🚀 [Github] 🎯 目标 提供方便快速的调试功能。 支持多样的输入源和输出源。 自动适配各种输入参数类型。 提供易维护、易拓展的API接口用于适配更多Leetcode算法调试场景。 🔧 下载与安装 下载 Maven <dependency> <groupId>io.github.jidcoo</groupId> <artifactId>leetcode-java-debug-enhancer</artifactId> <version>1.0.0</version> </dependency> Gradle implementation 'io.github.jidcoo:leetcode-java-debug-enhancer:1.0.0' Jar 资源 索引 托管仓库 点击这里浏览本项目的托管仓库 标准-Jar 点击这里直接下载(标准-Ja...
相关文章
文章评论
共有0条评论来说两句吧...
文章二维码
点击排行
推荐阅读
最新文章
- Eclipse初始化配置,告别卡顿、闪退、编译时间过长
- CentOS关闭SELinux安全模块
- Jdk安装(Linux,MacOS,Windows),包含三大操作系统的最全安装
- 设置Eclipse缩进为4个空格,增强代码规范
- CentOS7,8上快速安装Gitea,搭建Git服务器
- SpringBoot2整合MyBatis,连接MySql数据库做增删改查操作
- Red5直播服务器,属于Java语言的直播服务器
- CentOS8,CentOS7,CentOS6编译安装Redis5.0.7
- CentOS7,CentOS8安装Elasticsearch6.8.6
- Windows10,CentOS7,CentOS8安装MongoDB4.0.16