使用Spark Streaming SQL进行PV/UV统计
1.背景介绍 PV/UV统计是流式分析一个常见的场景。通过PV可以对访问的网站做流量或热点分析,例如广告主可以通过PV值预估投放广告网页所带来的流量以及广告收入。另外一些场景需要对访问的用户作分析,比如分析用户的网页点击行为,此时就需要对UV做统计。使用Spark Streaming SQL,并结合Redis可以很方便进行PV/UV的统计。本文将介绍通过Streaming SQL消费Loghub中存储的用户访问信息,对过去1分钟内的数据进行PV/UV统计,将结果存入Redis中。 2.准备工作 创建E-MapReduce 3.23.0以上版本的Hadoop集群。 下载并编译E-MapReduce-SDK包 git clone git@github.com:aliyun/aliyun-emapreduce-sdk.git cd aliyun-
