sqoop 从sqlserver2008 导入数据到hadoop-低调大师

sqoop 从sqlserver2008 导入数据到hadoop

2016-09-08 696

今天终于开始上手导入数据到hadoop了，哈哈，过程蛮崎岖的，和官方文档的还不太一样。

OK,let's go！试验对象是我第一个名为ST_Statistics的一张表，我要把我表里的数据导入到hdfs、hive以及hbase当中，然后试验才算完成。

1.导入数据到hdfs

sqoop import  --connect 'jdbc:sqlserver://192.168.1.105:1433;username=sa;password=cenyuhai;database=SAMS' \
          --query "SELECT * FROM ST_Statistics WHERE BigReason='OfficeSoftwareFault' AND \$CONDITIONS " \
              --split-by ResponseTime --target-dir /user/cenyuhai/sams

这里面有几个需要注意的点：

（1）--connect 后面的字符带上了'',为毛？其实我也不知道，官方文档上可不是这么说的，加上才可以跑。

（2）--split-by 后面跟的字段必须是整形的，因为sqoop是靠这个字段是给map线程分工的，不是整理它强转的时候就会报错的。

13/09/06 06:50:31 ERROR security.UserGroupInformation: PriviledgedActionException as:root cause:java.io.IOException: com.microsoft.sqlserver.jdbc.SQLServerException: 操作数数据类型 uniqueidentifier 对于 min 运算符无效。
13/09/06 06:50:31 ERROR tool.ImportTool: Encountered IOException running import job: java.io.IOException: com.microsoft.sqlserver.jdbc.SQLServerException: 操作数数据类型 uniqueidentifier 对于 min 运算符无效。
    at org.apache.sqoop.mapreduce.db.DataDrivenDBInputFormat.getSplits(DataDrivenDBInputFormat.java:167)
    at org.apache.hadoop.mapred.JobClient.writeNewSplits(JobClient.java:1054)
    at org.apache.hadoop.mapred.JobClient.writeSplits(JobClient.java:1071)
    at org.apache.hadoop.mapred.JobClient.access$700(JobClient.java:179)
    at org.apache.hadoop.mapred.JobClient$2.run(JobClient.java:983)
    at org.apache.hadoop.mapred.JobClient$2.run(JobClient.java:936)
    at java.security.AccessController.doPrivileged(Native Method)
    at javax.security.auth.Subject.doAs(Subject.java:396)
    at org.apache.hadoop.security.UserGroupInformation.doAs(UserGroupInformation.java:1232)
    at org.apache.hadoop.mapred.JobClient.submitJobInternal(JobClient.java:936)
    at org.apache.hadoop.mapreduce.Job.submit(Job.java:550)
    at org.apache.hadoop.mapreduce.Job.waitForCompletion(Job.java:580)
    at org.apache.sqoop.mapreduce.ImportJobBase.doSubmitJob(ImportJobBase.java:187)
    at org.apache.sqoop.mapreduce.ImportJobBase.runJob(ImportJobBase.java:16

（3）只要是语法不对的，它都会报下面这个错，希望大家注意！

At minimum, you must specify --connect and --table

Arguments to mysqldump and other subprograms may be supplied

after a '--' on the command line.

2.增量导入

sqoop支持两种增量导入到hive的模式，一种是 append，即通过指定一个递增的列，比如：

--incremental append --check-column id --last-value 0

另种是可以根据时间戳，比如：

　 --incremental lastmodified --check-column time --last-value '2013-01-01 11:0:00'

就是只导入time比'2013-01-01 11:0:00'更大的数据。

好，我试验的是第一种，我在插入了前面插入了差距的基础上，再插入WorkNo是201309071后面的数据（我新加的）。

sqoop import  --connect 'jdbc:sqlserver://192.168.1.105:1433;username=sa;password=cenyuhai;database=SAMS'  --table ST_Statistics \
  --where "BigReason='OfficeSoftwareFault'"   --split-by ResponseTime --target-dir /user/cenyuhai/sams \
  --incremental append  --check-column WorkNo  --last-value 201309071

执行成功，命令的提示当中会出现以下的提示，最后的值已经到201308081了。

13/09/06 22:26:15 INFO mapreduce.ImportJobBase: Retrieved 5 records.
13/09/06 22:26:15 INFO util.AppendUtils: Appending to directory sams
13/09/06 22:26:15 INFO util.AppendUtils: Using found partition 8
13/09/06 22:26:15 INFO tool.ImportTool: Incremental import complete! To run another incremental import of all data following this import, supply the following arguments:
13/09/06 22:26:15 INFO tool.ImportTool:  --incremental append
13/09/06 22:26:15 INFO tool.ImportTool:   --check-column WorkNo
13/09/06 22:26:15 INFO tool.ImportTool:   --last-value 201309081

3.导入到hive

sqoop import  --connect 'jdbc:sqlserver://192.168.1.105:1433;username=sa;password=cenyuhai;database=SAMS' \
             --table ST_Statistics --where "BigReason='OfficeSoftwareFault'" --split-by ResponseTime --hive-import  --create-hive-table

不知道为什么，执行hive的导入语句时，就不能用--query了，老报上面的那个提到的那个错误，可能是RP不好，就只能改成这种表加上过滤条件的方式了。然后用上面对hdfs的增量插入的方式对hive来操作也不成功，老是报前面提到的那个语法错误，真是让人无语了，报错都报得如此含蓄！

4.导入到hbase

sqoop import  --connect 'jdbc:sqlserver://192.168.1.105:1433;username=sa;password=cenyuhai;database=SAMS' --table ST_Statistics --where "BigReason='OfficeSoftwareFault'" --split-by ResponseTime  --hbase-table ST_Statistics --hbase-create-table   --hbase-row-key WorkNo  --column-family cf

这条语句非常长，为毛？我也不知道，这种写法我试了很多次了，用\来分行的写了很多次，一次都没成功，最后误打误撞，弄成一行它就成功运行了！

5.把数据从hdfs导回到sqlserver

把数据从hdfs导回到sqlserver，从hive导出也和这个一样，因为都是文本文件，hbase的话，也是不支持直接的，需要通过和hive结合，才能导出。　　

sqoop export  --connect 'jdbc:sqlserver://192.168.1.105:1433;username=sa;password=cenyuhai;database=SAMS' \
              --table ST_Statistics2 --export-dir /user/cenyuhai/sams

微信关注我们

原文链接：https://yq.aliyun.com/articles/60291

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

Hbase 学习（八）使用MapReduce&华为二级索引（原理）

在hbase的demo里面有个IndexBuilder的例子，它就是使用了MapReduce来操作hbase的，例子也比较简单，但是只包括了Mapper。另外网上还有另外一个例子，也是说明这个的，这个例子更为全面一点，包括了Mapper和Reducer。 http://www.cnblogs.com/chenli0513/archive/2012/01/06/2314886.html 这里就不说什么了，很简单，一看就懂。这个是华为的二级索引方案，已经开放源代码了,下面是网上的一篇讲解原理的帖子，发出来和大家共享一下。经过本人认真阅读了一下代码，发现这个源码仅供参考，想要集成到原有的集群当中是有点儿难度的，它对hbase的源码进行不少的修改。源码地址： https://github.com/Huawei-Hadoop/hindex 下面来对其方案做一个分析。 1.整体架构这个架构在Client Ext中设定索引细节，在Balancer中收集信息，在Coprocessor中管理二级索引数据。 2.表创建在创建表的时候，在同一个region server上创建索引表，且一一对应...

2016-09-08

798

HBase Snapshots允许你对一个表进行快照（即可用副本），它不会对Region Servers产生很大的影响，它进行复制和恢复操作的时候不包括数据拷贝。导出快照到另外的集群也不会对Region Servers产生影响。下面告诉你如何使用Snapshots功能。 1. 开启快照支持功能，在0.95+之后的版本都是默认开启的，在0.94.6+是默认关闭。 <property> <name>hbase.snapshot.enabled</name> <value>true</value> </property>2. 给表建立快照，不管表是启用或者禁用状态，这个操作不会进行数据拷贝。 $ ./bin/hbase shell hbase> snapshot 'myTable', 'myTableSnapshot-122112'3. 列出已经存在的快照 $ ./bin/hbase shell hbase> list_snapshots4. 删除快照 $ ./bin/hbase shell hbase&...

2016-09-08

785

资源下载

更多资源

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题，腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构，目前腾讯云软件源站支持公网访问和内网访问。

Nacos

Nacos /nɑ:kəʊs/ 是 Dynamic Naming and Configuration Service 的首字母简称，一个易于构建 AI Agent 应用的动态服务发现、配置管理和AI智能体管理平台。Nacos 致力于帮助您发现、配置和管理微服务及AI智能体应用。Nacos 提供了一组简单易用的特性集，帮助您快速实现动态服务发现、服务配置、服务元数据、流量管理。Nacos 帮助您更敏捷和容易地构建、交付和管理微服务平台。

Rocky Linux

Rocky Linux（中文名：洛基）是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版，作为CentOS稳定版停止维护后与RHEL（Red Hat Enterprise Linux）完全兼容的开源替代方案，由社区拥有并管理，支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性，采用模块化包装和SELinux安全架构，默认包含GNOME桌面环境及XFS文件系统，支持十年生命周期更新。

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能，例如代码缩略图，Python的插件，代码段等。还可自定义键绑定，菜单和工具栏。Sublime Text 的主要功能包括：拼写检查，书签，完整的 Python API ， Goto 功能，即时项目切换，多选择，多窗口等等。Sublime Text 是一个跨平台的编辑器，同时支持Windows、Linux、Mac OS X等操作系统。