首页 文章 精选 留言 我的

精选列表

搜索[企业应用],共10000篇文章
优秀的个人博客,低调大师

PgSQL · 应用案例 · 传统分库分表(sharding)的缺陷与破解之法

背景 随着互联网的发展,数据爆炸性的增长,数据库逐渐成为了很多业务的绊脚石,很多业务也哭着喊着要上分布式数据库。 但是,传统的分库分表(sharding)带来的问题较多,得不偿失 传统分库分表问题 1、 扩容不方便(需要重分布数据) 2、 分布键变更很麻烦 3、 分布键选择(架构设计)需要谨慎,甚至很多sharding产品不支持多个分布键、或者不支持随机分布,导致业务不得不使用没有任何意义的自增序列来作为分布键。 4、 无法支持复杂查询。跨库JOIN性能差,甚至只能按分布键JOIN,其他字段不支持JOIN。(因为这种产品架构数据节点之间是孤岛,数据需要在孤岛之间交互,需要通过上层的中间件节点,而这样的话,如果有跨库JOIN,就需要将数据收到中间件节点再JOIN,性能差是可想而知的,甚至打爆中间节点。) 5、 当需要写入、返回大量结果集时,可能把中

优秀的个人博客,低调大师

Java之dom4j的简单解析和生成xml的应用

一、dom4j是一个Java的XML API,是jdom的升级品,用来读写XML文件的。dom4j是一个十分优秀的JavaXML API,具有性能优异、功能强大和极其易使用的特点,它的性能超过sun公司官方的dom技术,同时它也是一个开放源代码的软件,可以在SourceForge上找到它。在IBM developerWorks上面还可以找到一篇文章,对主流的Java XML API进行的性能、功能和易用性的评测,所以可以知道dom4j无论在哪个方面都是非常出色的。如今可以看到越来越多的Java软件都在使用dom4j来读写XML,特别值得一提的是连Sun的JAXM也在用dom4j。这已经是必须使用的jar包, Hibernate也用它来读写配置文件。 二、dom4j的xml解析过程 1)加入依赖包 <dependency> <groupId>org.dom4j</groupId> <artifactId>dom4j</artifactId> <version>2.1.0</version> </dependency> <dependency> <groupId>com.google.code.gson</groupId> <artifactId>gson</artifactId> <version>2.8.2</version> </dependency> 说明:gson的目的是用来将数据转成json的形式 2)xml模板 <root> <test1>test1</test1> <test1>test11</test1> <test2> <test3>test3</test3> <test4>test4</test4> </test2> <test2> <test3>test5</test3> <test4>test6</test4> </test2> </root> 3)解析 import com.google.gson.Gson; import com.google.gson.JsonArray; import com.google.gson.JsonObject; import org.dom4j.Document; import org.dom4j.Element; import org.dom4j.io.SAXReader; import java.io.File;import java.util.List; public class Dom4jUtil { public static void main(String[] args) throws Exception { SAXReader reader = new SAXReader(); Document document = reader.read(new File("d:\\1.xml")); Element root = document.getRootElement(); JsonObject jsonObject = readXml(root); JsonObject jsonObjectRepetition = readXmlRepetition(root); Gson gson = new Gson(); System.out.println(gson.toJson(jsonObject)); System.out.println(gson.toJson(jsonObjectRepetition)); } /** * 处理存在重复的标签数据(弊端,所有数据都是数组的方式存在,对xml的设计有要求,不然数据不好处理) * @param root * @return */ public static JsonObject readXmlRepetition(Element root) { //获取节点下面的所有元素 List<Element> elements = root.elements(); //如果存在则处理数据或者直接返回节点数据 if (elements != null && elements.size() > 0) { //声明一个json数据 JsonObject jsonObject = new JsonObject(); //声明一个json数组 JsonArray mList = new JsonArray(); //遍历所有元素 for (Element element:elements) { //读取节点数据直到节点下面没有其他元素 JsonObject jo = readXml(element); mList.add(jo); } //加入json jsonObject.add(root.getName(), mList); return jsonObject; } else { JsonObject jsonObject = new JsonObject(); jsonObject.addProperty(root.getName(), root.getText()); return jsonObject; } } /** * 处理普通xml格式数据,不存在重复的标签(弊端,不能处理统一标签下的重复标签) * @param root * @return */ public static JsonObject readXml(Element root) { //获取节点下面的所有元素 List<Element> elements = root.elements(); //如果存在则处理数据或者直接返回节点数据 if (elements != null && elements.size() > 0) { //声明一个json数据 JsonObject map = new JsonObject(); //这个是处理所有下面的数据保存在一个json中 JsonObject jo = new JsonObject(); for (Element element:elements) { JsonObject m = readXml(element); jo.add(element.getName(), m.get(element.getName())); } map.add(root.getName(), jo); return map; } else { JsonObject map = new JsonObject(); map.addProperty(root.getName(), root.getText()); return map; } } } 4)测试结果展示 {"root":{"test1":"test11","test2":{"test3":"test5","test4":"test6"}}} {"root":[{"test1":"test1"},{"test1":"test11"},{"test2":{"test3":"test3","test4":"test4"}},{"test2":{"test3":"test5","test4":"test6"}}]} 三、重点说明一下 1)上面写出来的工具,基本上都是用来处理特定数据的工具 2)方法的实现上面还可以完善,但是我一直没有找到好的数据表现形式所以写了两个方法 3)可以参考这种做法,进一步做深度解析 四、xml的创建 public static void main(String[] args) throws Exception { Document document = DocumentHelper.createDocument(); Element root = document.addElement("root"); Element test1 = root.addElement("test1"); test1.addText("test1"); Element test2 = root.addElement("test2"); test2.addText("test2"); OutputStream outputStream = new FileOutputStream("d:\\2.xml"); XMLWriter xmlWriter = new XMLWriter(outputStream); xmlWriter.write(document); xmlWriter.close(); } 备注:这里xml创建不细讲,很多时候都是根据业务来的。

优秀的个人博客,低调大师

python实现地理位置类数据爬取与geohash应用初探

最近想做一个简单的地理位置分析,比如获取一些城市公交站点对应的geohash,geohash其实是将平时常见的经纬度进行了降维,这样可以进行类似附近的餐馆等内容的分析。 1. 正逆地理编码 http://lbsyun.baidu.com/index.php?title=webapi/guide/webservice-geocoding 正/逆地理编码服务(又名Geocoding API)是一类Web API接口服务; 正向地理编码服务提供将结构化地址数据(如:北京市海淀区上地十街十号)转换为对应坐标点(经纬度)功能; 逆向地理编码服务提供将坐标点(经纬度)转换为对应位置信息(如所在行政区划,周边地标点分布)功能。 1.1 百度地图api正逆地理编码存在偏差 百度地图坐标拾取 http://api.map.baidu.com/lbsapi/getpoint/index.html 可以直接使用的百度url:后面直接跟地址就好如上图(key不知道是谁的),可以发现百度的搜索分词权重直接把雍和宫地铁站定位到了雍和宫, http://api.map.baidu.com/geocoder?key=f247cdb592eb43ebac6ccd27f796e2d2&output=json&address= url new key: http://api.map.baidu.com/geocoder?key=xpKTc80ZnEGiy1elZCMtEepEYKj5tqQr&output=json&address= http://api.map.baidu.com/geocoder/v2/?address=&output=json&ak=xpKTc80ZnEGiy1elZCMtEepEYKj5tqQr 1.2 高德地图接口 高德地图坐标拾取 http://lbs.amap.com/console/show/picker 发送一个request请求,带上地理位置和api key 即可返回一个包含了经纬度str。 地理编码接口: # -*- coding: utf-8 -*- import requests def geocode_change_key(address,key): parameters = {'address': address, 'key': key} base = 'http://restapi.amap.com/v3/geocode/geo' response = requests.get(base, parameters) answer = response.json() return str(answer['geocodes'][0]['location']).split(',') 2. 坐标系 谷歌地图采用的是WGS84地理坐标系(中国范围除外) 谷歌中国地图、搜搜中国地图、高德地图采用的是GCJ02地理坐标系 百度采用的是BD09坐标系。 而设备一般包含GPS芯片或者北斗芯片获取的经纬度为WGS84地理坐标系。 所以我们要根据得到的经纬度的坐标类型和地图厂商类型在地图上标点,否则会出现获取的位置误差。为什么不统一用WGS84地理坐标系这就是国家地理测绘总局对于出版地图的要求,出版地图必须符合GCJ02坐标系标准,也就是国家规定不能直接使用WGS84地理坐标系。 百度坐标系说明书:http://lbsyun.baidu.com/index.php?title=coordinate 2.1 我们常说的坐标系 WGS84:为一种大地坐标系,也是目前广泛使用的GPS全球卫星定位系统使用的坐标系。 GCJ02:又称火星坐标系,是由中国国家测绘局制定的地理坐标系统,是由WGS84加密后得到的坐标系。 BD09:为百度坐标系,在GCJ02坐标系基础上再次加密。其中bd09ll表示百度经纬度坐标,bd09mc表示百度墨卡托米制坐标。 2.2 坐标转码关键代码 # -*- coding: utf-8 -*- import json import urllib import math x_pi = 3.14159265358979324 * 3000.0 / 180.0 pi = 3.1415926535897932384626 # π a = 6378245.0 # 长半轴 ee = 0.00669342162296594323 # 扁率 def gcj02_to_bd09(lng, lat): """ 火星坐标系(GCJ-02)转百度坐标系(BD-09) 谷歌、高德——>百度 :param lng:火星坐标经度 :param lat:火星坐标纬度 :return: """ z = math.sqrt(lng * lng + lat * lat) + 0.00002 * math.sin(lat * x_pi) theta = math.atan2(lat, lng) + 0.000003 * math.cos(lng * x_pi) bd_lng = z * math.cos(theta) + 0.0065 bd_lat = z * math.sin(theta) + 0.006 return [bd_lng, bd_lat] def bd09_to_gcj02(bd_lon, bd_lat): """ 百度坐标系(BD-09)转火星坐标系(GCJ-02) 百度——>谷歌、高德 :param bd_lat:百度坐标纬度 :param bd_lon:百度坐标经度 :return:转换后的坐标列表形式 """ x = bd_lon - 0.0065 y = bd_lat - 0.006 z = math.sqrt(x * x + y * y) - 0.00002 * math.sin(y * x_pi) theta = math.atan2(y, x) - 0.000003 * math.cos(x * x_pi) gg_lng = z * math.cos(theta) gg_lat = z * math.sin(theta) return [gg_lng, gg_lat] def wgs84_to_gcj02(lng, lat): """ WGS84转GCJ02(火星坐标系) :param lng:WGS84坐标系的经度 :param lat:WGS84坐标系的纬度 :return: """ if out_of_china(lng, lat): # 判断是否在国内 return lng, lat dlat = _transformlat(lng - 105.0, lat - 35.0) dlng = _transformlng(lng - 105.0, lat - 35.0) radlat = lat / 180.0 * pi magic = math.sin(radlat) magic = 1 - ee * magic * magic sqrtmagic = math.sqrt(magic) dlat = (dlat * 180.0) / ((a * (1 - ee)) / (magic * sqrtmagic) * pi) dlng = (dlng * 180.0) / (a / sqrtmagic * math.cos(radlat) * pi) mglat = lat + dlat mglng = lng + dlng return [mglng, mglat] def gcj02_to_wgs84(lng, lat): """ GCJ02(火星坐标系)转GPS84 :param lng:火星坐标系的经度 :param lat:火星坐标系纬度 :return: """ if out_of_china(lng, lat): return lng, lat dlat = _transformlat(lng - 105.0, lat - 35.0) dlng = _transformlng(lng - 105.0, lat - 35.0) radlat = lat / 180.0 * pi magic = math.sin(radlat) magic = 1 - ee * magic * magic sqrtmagic = math.sqrt(magic) dlat = (dlat * 180.0) / ((a * (1 - ee)) / (magic * sqrtmagic) * pi) dlng = (dlng * 180.0) / (a / sqrtmagic * math.cos(radlat) * pi) mglat = lat + dlat mglng = lng + dlng return [lng * 2 - mglng, lat * 2 - mglat] def bd09_to_wgs84(bd_lon, bd_lat): lon, lat = bd09_to_gcj02(bd_lon, bd_lat) return gcj02_to_wgs84(lon, lat) def wgs84_to_bd09(lon, lat): lon, lat = wgs84_to_gcj02(lon, lat) return gcj02_to_bd09(lon, lat) def _transformlat(lng, lat): ret = -100.0 + 2.0 * lng + 3.0 * lat + 0.2 * lat * lat + \ 0.1 * lng * lat + 0.2 * math.sqrt(math.fabs(lng)) ret += (20.0 * math.sin(6.0 * lng * pi) + 20.0 * math.sin(2.0 * lng * pi)) * 2.0 / 3.0 ret += (20.0 * math.sin(lat * pi) + 40.0 * math.sin(lat / 3.0 * pi)) * 2.0 / 3.0 ret += (160.0 * math.sin(lat / 12.0 * pi) + 320 * math.sin(lat * pi / 30.0)) * 2.0 / 3.0 return ret def _transformlng(lng, lat): ret = 300.0 + lng + 2.0 * lat + 0.1 * lng * lng + \ 0.1 * lng * lat + 0.1 * math.sqrt(math.fabs(lng)) ret += (20.0 * math.sin(6.0 * lng * pi) + 20.0 * math.sin(2.0 * lng * pi)) * 2.0 / 3.0 ret += (20.0 * math.sin(lng * pi) + 40.0 * math.sin(lng / 3.0 * pi)) * 2.0 / 3.0 ret += (150.0 * math.sin(lng / 12.0 * pi) + 300.0 * math.sin(lng / 30.0 * pi)) * 2.0 / 3.0 return ret def out_of_china(lng, lat): """ 判断是否在国内,不在国内不做偏移 :param lng: :param lat: :return: """ return not (lng > 73.66 and lng < 135.05 and lat > 3.86 and lat < 53.55) if __name__ == '__main__': lng = lat = # result1 = gcj02_to_bd09(lng, lat) # result2 = bd09_to_gcj02(lng, lat) # result3 = wgs84_to_gcj02(lng, lat) result4 = gcj02_to_wgs84(lng, lat) #result5 = bd09_to_wgs84(lng, lat) #result6 = wgs84_to_bd09(lng, lat) print (result4) 3. geohash https://www.cnblogs.com/LBSer/p/3310455.html 当geohash base32编码长度为8时,精度在19米左右,而当编码长度为9时,精度在2米左右,所以一般来说用八位就够用。 python3如何使用geohash呢,网上说使用pip install geohash后import geohash 会报错,当然同样的作者提供了geohash包的fix版geohash2,所以安装时候应该是:(改源码的方式有点太高大上,不太安全?) pip install geohash2 我很纳闷的是python中能够生成geohash 的包实在是太多了: 3.1 获取包围盒 可以看到7位geohash编码带上一个包围盒,相对于6位geohash编码准确许多 简单写了一个类,使用geohash2(作者居然没有提供),我只好复制了mzgeohash的部分代码 https://gitee.com/wangyaning/python/tree/master/geohash 可以直接这么用: if __name__=='__main__': myTestGeohash = MyGeohash() #wx4g340 print(myTestGeohash.getneighbors('wx4g340')) 输出如下: {'ne': 'wx4g343', 'n': 'wx4g342', 'w': 'wx4g2fp', 'c': 'wx4g340', 'sw': 'wx4g2cz', 'se': 'wx4g31c', 'nw': 'wx4g2fr', 'e': 'wx4g341', 's': 'wx4g31b'} 测试geohash查询接口 https://cevin.net/geohash/ 结构化数据的处理 爬好数据的后处理,入库 新学了sqlldr命令,挺快,连python代码都不用写了 sqlldr userid='username/password@serverip/instance' control=./xxx.ctl errors=99999999 rows=20000 direct=true data=xxxxxxx.txt xxx.ctl文件如下 LOAD DATA CHARACTERSET 'UTF8' INFILE * APPEND INTO TABLE TABLENAME FIELDS TERMINATED BY ',' OPTIONALLY ENCLOSED BY '"&*!' trailing nullcols ( linename , xxxxxx, xxxxxx ) 部分参考文献 简单的城市名转换成经纬度: https://www.cnblogs.com/zle1992/p/7209932.html 批量获取经纬度: https://www.cnblogs.com/reboot777/p/7124010.html 用Python计算北京地铁的两站间最短换乘路线: http://blog.csdn.net/myjiayan/article/details/45954679 使用爬虫获取获取所有的 站点名 http://blog.csdn.net/wenwu_both/article/details/70168760 高德地图地理编码服务 http://blog.csdn.net/u013250416/article/details/71178156 https://www.cnblogs.com/xautxuqiang/p/6241561.html

优秀的个人博客,低调大师

应用Splunk进行大规模、非结构性数据的检索和分析

——更轻松、更高效的MapReduce并行分析模式 MapReduce 是 2004年由Google开发的分散式数据处理模型。 MapReduce 的基本设计理念是把 问题分成两个部分:1)将源数据转换成充分统计数据的映射函数;2)将所有充分统计数据合并为最终答 案的化简函数。通过定义,所有并行映射函数可同时运行且不会相互影响。一旦使用映射函数运算所有数 据,就可结合映射阶段的结果进行化简函数运算。对于网页搜索分析方案中常见的大规模批量处理和高速数据检索,MapReduce 能够提供最快速、最 节省且最大规模的数据返回程序。当今,大部分“大规模数据”先进管理技术是基于MapReduce研发的。

资源下载

更多资源
Mario

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长,特征是大鼻子、头戴帽子、身穿背带裤,还留着胡子。与他的双胞胎兄弟路易基一起,长年担任任天堂的招牌角色。

腾讯云软件源

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题,腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构,目前腾讯云软件源站支持公网访问和内网访问。

Rocky Linux

Rocky Linux

Rocky Linux(中文名:洛基)是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版,作为CentOS稳定版停止维护后与RHEL(Red Hat Enterprise Linux)完全兼容的开源替代方案,由社区拥有并管理,支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性,采用模块化包装和SELinux安全架构,默认包含GNOME桌面环境及XFS文件系统,支持十年生命周期更新。

Sublime Text

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能,例如代码缩略图,Python的插件,代码段等。还可自定义键绑定,菜单和工具栏。Sublime Text 的主要功能包括:拼写检查,书签,完整的 Python API , Goto 功能,即时项目切换,多选择,多窗口等等。Sublime Text 是一个跨平台的编辑器,同时支持Windows、Linux、Mac OS X等操作系统。

用户登录
用户注册