探访美式微博Twitter的大数据技术架构
Twitter要上市了,再一次让全球瞩目,正是它所创造的twitte让互联网进入了微创新的时代。虽然它没有进入中国,但受其启发的新浪微博和腾讯微博在中国互联网上也成为一道亮丽的风景。Twitter在全球拥有巨大的用户群,海量的社交信息流,支撑其运转的大数据技术架构也颇受人关注。
Twitter的大数据架构也是分为基于Hadoop的批处理和基于Storm的实时流计算等主要类型,主要基于开源项目中进行开发和发展。Twitter收集数据采用的是Facebook开源的日志工具Scribe,批处理地存储和分析数据采用Hadoop+MapReduce,在大数据上的快速分析采用Pig。Pig是基于Hadoop的并行计算高级编程语言,它提供一种类SQL的数据分析高级文本语言,称为Pig Latin,该语言的编译器会把类SQL的数据分析请求转换为