首页 文章 精选 留言 我的

精选列表

搜索[AI漏洞挖掘],共10000篇文章
优秀的个人博客,低调大师

Python | 数据挖掘,WordCloud词云配置过程及词频分析

一. 安装WordCloud 在使用WordCloud词云之前,需要使用pip安装相应的包。 pip install WordCloud pip install jieba 其中WordCloud是词云,jieba是结巴分词工具。 问题:在安装WordCloud过程中,你可能遇到的第一个错误如下。 error: Microsoft Visual C++ 9.0 is required. Get it from http://asa.ms/vcpython27 解决方法也很简单,下载VCForPython27安装(Microsoft Visual C++ Compiler for Python 2.7)。但是在微软下载总是没响应。 这是最大的问题,下面我自己提供一个CSDN的地址供大家下载。下载完成,可以进行安装响应的库函数。 资源地址: http://download.csdn.net/detail/eastmount/9788218 安装完成之后,可以正常运行代码啦。 二. 简单词云代码 下面这部分代码参考老曹的,希望对你有所帮助。 老曹说:什么是词云呢?词云又叫文字云,是对文本数据中出现频率较高的“关键词”在视觉上的突出呈现,形成关键词的渲染形成类似云一样的彩色图片,从而一眼就可以领略文本数据的主要表达意思。 代码如下: 这是中文编码问题,下面讲解解决方法。 三. 中文编码错误及解决 在WordCloud安装的目录下找到WordCloud.py文件,对源码进行修改。 注意,此时运行代码还是报错,因为需要在同一个目录下放置msyh.ttf字体文件供程序调用,如下图所示,这是原来的字体DroidSansMono.ttf。 也可以采用下面的代码: wordcloud = WordCloud(font_path = 'MSYH.TTF').fit_words(word) 四. 照片背景的词云代码 下面进一步深入,假设存在一个图 "sss3.png",核心代码如下: 原文发布时间为:2018-09-18 本文作者: 上海小胖 本文来自云栖社区合作伙伴“ Python专栏”,了解相关信息可以关注“ Python专栏”。

优秀的个人博客,低调大师

用Python对用户评论典型意见进行数据挖掘

用户体验的工作可以说是用户需求和用户认知的分析。而消费者的声音是其中很重要的一环,它包含了用户对产品的评论,不管是好的坏的,都将对我们产品的改进和迭代有帮助。另外任何事情都要考虑金钱成本和人力成本,因此我希望能通过机器学习的算法来辅助分析,对用户的评论数据进行提炼和洞察。 一、数据获取和清洗 现在爬虫泛滥,网络公开数据的获取并不再是一个难题。简单点可以利用一些互联网的爬虫服务(如神箭手、八爪鱼等),复杂点也可以自己写爬虫。这里我们用爬虫来获取京东的评论数据。相对于亚马逊而言,京东比较坑。第一个坑是京东的反爬虫还不错,通过正常产品网址进去的那个评论列表是几乎爬不出数据来的,所有大部分网络爬虫服务都止步于此。第二个坑是一款产品的评论数只要超过一万条,那么京东就只会显示前一千条,没有公开的数据,那你爬虫技术再厉害也没办法,除非开着爬虫定时增

优秀的个人博客,低调大师

Python数据分析与挖掘所需的Pandas常用知识

前言 Pandas基于两种数据类型:series与dataframe。 一个series是一个一维的数据类型,其中每一个元素都有一个标签。series类似于Numpy中元素带标签的数组。其中,标签可以是数字或者字符串。 一个dataframe是一个二维的表结构。Pandas的dataframe可以存储许多种不同的数据类型,并且每一个坐标轴都有自己的标签。你可以把它想象成一个series的字典项。 Pandas常用知识 一、读取csv文件为dataframe二、dataframe的数据概况三、取列数据四、取行数据五、取某一单元格数据六、缺失值处理七、归一化处理八、排序九、索引重新编号十、求均值十一、矢量化操作(批量操作)十二、透视表 一、读取csv文件为dataframe Pandas很好的一点是,可以操作表文件。输出为dataframe格式,这点很nice。 使用pandas.read_csv()读取csv文件,输出为dataframe格式数据。 这里数据data.csv数据集下载自百度地图。 import pandas as pd filepath = r'C:/Users/lenovo/Desktop/20180108-百度地图/20180108-百度地图/data.csv' df = pd.read_csv(filepath) #为了方便,我只显示三行,其实结果并不是这样子 print(df) 检测下数据格式 #检测下数据格式是否为DataFrame print(type(df)) #输出class 'pandas.core.frame.DataFrame 二、 DataFrame数据概况 我们想知道数据如下知识: 展示dataframe前后几条记录 显示dataframe的列名字 查看dataframe的维度情况(几行几列) 2.1展示dataframe前后几行 #展示前两条记录(根据需要显示条数) df.head(2) print(df.head(2)) #展示后三条记录 df.tail(3) print(df.tail(3)) 2.2展示dataframe列名 #展示列名 col_names = df.columns print(col_names) #查看下col_names格式 type(col_names) #将col_names转化为list col_list = col_names.tolist() col_list 三、从dataframe中取列数据 使用dataframe[column_name],返回series格式数据。 series序列数据类似于list,你可以近似等同于list。 只不过返回数据中会多一列index索引。如下面的左侧数字序号 3.1 取一列数据 #这里我们一列,如取Name列数据 df['Name'][:5] print(df['Name'][:5]) 3.2取多列数据 #这里返回的数据还是dataframe格式,为了方便也只显示前几条记录 cols = ['name', 'province_name', 'city_name', 'city_code', 'area', 'addr'] df[cols] print(df[cols]) 四、从dataframe中取行数据(记录) ix[row, col] 中括号中第一个参数row是行参数,你想选择的数据行数。 第二个参数col是列参数,选择你想要的列数据项。 4.1取一行数据 #第一行所有数据 df.ix[0, :] print(df.ix[0, :]) #第一行的某几列数据 col = ['Survived', 'Pclass', 'Sex'] df.ix[0, col] print(df.ix[0, col]) 2取多行数据 #取多行数据,所有列。这里我选择前5行,所有列. #这里是不是很像切片操作。python基础很重要 df.ix[:5, :] print(df.ix[:5, :]) #取多行,某几列 df.ix[:5, col] print(df.ix[:5, col]) 五、取某一单元格数据 取第一行第一列。df.ix[0,0] 第三行第七列。df.ix[2,6] 六、缺失值处理 缺失值一般标记为NaN,处理办法如下 df.dropna(axis) 默认直接使用df.dropna() axis=1,按照行进行缺失值处理 axis=0,按照列进行缺失值处理 df.dropna(axis=0,subset) axis=0,按照列方向处理subset中的列缺失值 subset=[column] subset含有一个或多个列名的的list 6.1按照行进行缺失值处理 #按照列处理缺失值(为显示方便,只显示前5行) df.dropna(axis=0) #对指定列进行缺失值处理 df.dropna(axis=0,subset=['Sex','Age']) 七、归一化处理 数据集中,不同的列的数据可能在不同量级,如果直接进行分析。模型会认为数字大的影响力大,数字小的影响力小。 最终结果可能导致量级小的变量被剔除出模型。因此需要将数据归一化,变成同一量级的数据,这就是归一化操作。 在这里我们只对一列操作下,其余列也需要操作,但为了方便,这里只写一列的归一化处理。 处理步骤: 1.选取该列的最大值 max_value = df[col].max() 2.该列所有值均除以max_value 这里要注意,我们会用到pandas特性,矢量化操作,也就是可以对一个列表进行批量同样的操作。 #这里我们选Fare列进行归一化,先看下Fare的数据 #为了方便显示,只显示了前10个 df['Fare'] #这里我们选Fare列进行归一化 max_value = df['Fare'].max() max_value #这里我们选Fare列进行归一化 max_value = df['Fare'].max() max_value #归一化,并将数据传入新列new_Fare df['new_Fare']=df['Fare']/max_value df['new_Fare'] 八、排序 df.sort_values(col,inplace,ascending) col 对col列进行排序 inplace 布尔型值,是否原地操作。 True时,操作结果覆盖掉原数据,原数据被修改 False时,新建一个新数据,原数据未被修改 ascending 布尔型值。升序降序。 False降序,True升序 #对Age列进行降序操作,不修改原始数据 df.sort_values('Age',inplace=False,ascending=False) 九、索引重新 将排序后的索引重新排序 df.reset_index(drop) drop 为布尔型值,True表示修改原始数据的索引。 False保留原始数据索引序列。 df.reset_index(drop=False) 十、求平均值 10.1所有列的平均值信息 df.mean() 10.2 单个列的平均值 df['Age'].mean() 十一、矢量化操作(批量操作) 一般对如list样式的数据批量操作,需要写循环,但是这样费时费力。 pandas基于numpy,可进行矢量化操作,一行就能完成复杂的循环语句,而且运行效率还很高。 #对Age列批量加10 df['Age']+10).head #对Age列批量减20 df['Age']-10 十二、透视表 df.pivot_table(index=col1,values=col2,aggfunc='numpy函数') 围绕index参数列,分析各个col2,aggfunc是np函数,当然这里的aggfunc也可以是自定义函数。 #分析平均年龄对对生存率的影响。 #0为死亡,1为生存。 #这里我们发现年龄对生存率有影响。 import numpy as np df.pivot_table(index='Survived',values='Age',aggfunc=np.mean) #分析仓位等级对生存率影响。0为死亡,1为生存。 #仓位为一等二等三等分别取值1,2,3 #一等舱最高级。我们发现仓位等级对生存也有影响。 df.pivot_table(index='Survived',values='Pclass',aggfunc=np.mean) pandas提取html中的表格数据 pandas会在网页中寻找任何符合html表形式的数据,并将其转化WieDataFrame对象作为返回结果 Code pandas使用方法 import pandas as pd #header=1 显示列名;header=0,不显示 pd.read_html(url,header) 实战代码开始 import pandas as pd url = "http://hz.house.ifeng.com/detail/2014_10_28/50087618_1.shtml" data = pd.read_html(url,header=1) print(data) 注意啊,这里得到的数据格式是list。 [ 序号 楼盘名称 城区 签约套数 预定套数 签约面积(㎡)签约均价(元/㎡) 0 1.0 龙湖春江郦城 滨江 18 0 2178.61 23757.0 1 2.0 海威钱塘之星 滨江 13 0 629.55㎡ 17398.0 2 3.0 大家运河之星 拱墅 12 0 1052.72㎡ 10457.0 3 4.0 保利城市果岭 下沙 8 0 743.05㎡ 10457.0 .. ... ... ... ... ... ... ... 85 86.0 广宇锦绣桃源 拱墅 1 0 86.44㎡ 12473.0 86 87.0 景瑞申花壹号院 拱墅 1 0 89.18㎡ 21529.0 87 88.0 复地黄龙和山 西湖 0 1 0㎡ 0.0 88 89.0 中粮方圆府 下城 0 1 0㎡ 0.0 89 90.0 东方铭楼 下沙 0 16 0㎡ 0.0 90 NaN 总计签约: 主城区 216 40 21755.55㎡ NaN [91 rows x 7 columns], 2 DataFrame对象 df.to_json() 而只要知道数据存储在DataFrame中,一切都变的简单起来。 比如我很希望数据以json记形式输出,很简单!这只是一行代码的事情。 import pandas as pd data = pd.read_html(url,header=1) #data数据是list类型,要先转化为dataframe df = pd.DataFrame(data) df.to_json(orient='records') df.to_csv() dataframe对象,还可以将数据输出保存为csv文件 import pandas as pd data = pd.read_html(url,header=1) df = pd.DataFrame(data) #encoding为gbk编码,可以在office excel中看中文不乱吗 df.to_csv('data.csv',encoding='gbk') 转自:https://mp.weixin.qq.com/s?__biz=MzI5NDY1MjQzNA==&mid=2247485475&idx=1&sn=81f5a117335181a9e846b84e20bd921a&chksm=ec5ed75edb295e48538eea0e7c28d4bbbffdd3405784d3019db5f65592424ef4a0fab18f73ab&mpshare=1&scene=23&srcid=0208YIogc0ZyLNbYf1ISMvMx#rd

优秀的个人博客,低调大师

蓦然认知带你挖掘IoT时代对话交互的深度价值

3月28日,蓦然认知CEO戴帅湘出席了2017春季人工智能产业峰会,并做《对话及应用-自然语言交互的未来及挑战》主题演讲,在之后的创新论坛上与众多行业大咖进行深度交流,全面阐述了蓦然认知的智能交互决策引擎Mor基于DAAA理念的商业价值和技术价值。 人机交互的发展先后经历了互联网普及前的桌面时代、互联网普及后的浏览器时代和手机出现后的移动时代,是一个逐步解放双手的过程,也是一个不断智能化的过程。如今,一个全新的时代——IoT时代正在到来,在这个时代,语音交互将是科技发展新风口。 为了更好地适应时代要求,蓦然认知不断优化自身,通过和内容、服务提供商的通力合作,着力于将优质的内容和服务进行整合,提供给有需求的用户。另外在技术上也不断寻求突破,总结以前的智能语音助手在对话和场景处理上的不足,转化为自身的优势。 戴帅湘认为,在IoT时代,

优秀的个人博客,低调大师

环保牵手大数据 佛企需反向挖掘数据价值

近几年,环保产业和互联网产业以愈发多样的形式拥抱彼此。环保是传统产业,其产业链条较长,囊括设计、生产、流通运输、服务等全过程,这些环节都具备和互联网结合的潜力。这一特点也赋予了整个“互联网+”环保业巨大的市场空间。在佛山,一场浩大的转型升级浪潮将环保号角吹得更响,强大的制造能力让佛山驻扎着不少环保企业的供应商。具备了需求与供应的两头优势,佛山的互联网+环保产业大有作为。 其实,在“互联网+”大潮袭来时,传统的环保企业是诚惶诚恐的。一方面,从传统产业到互联网的跨界是一件新事物,必然面临挑战。环保这个传统产业有自己的门槛,在涉足互联网时它会比消费类产业的适应效率慢一拍。加之环保市场的开放还不算充分,互联网+环保对需求端的感知同样会慢一拍。同时,环保事业的发展规范与要求在不断变化,再加上同样频繁更新的互联网行业,两者的结合可谓是变量与变量的叠加,让互联网+环保这一新兴产业也充满变数。 另一方面,不少互联网企业也跨界到环保领域一显身手。2014年8月,百度就跨界进入废旧电器回收行业,与传统环保企业合作开发一款应用,为居民提供O2O的旧物垃圾回收服务。同样在环保领域布局的还有高德。高德地图中的“躲避拥堵”就具有环保功能——匀速行驶状态下,汽车尾气排放较少。这些企业本身具有互联网思维和技术优势,让环保企业感受到一种危机感。 不过在佛山,互联网+环保却拥有巨大的成长空间。目前佛山正展开新一轮的制造业转型升级,这也倒逼各企业抬高了环保的门槛,催生了大量的环保产业市场需求。如对企业排污口各项排污指标进行在线监测,为企业提供环保指导建议等等,这些环保服务都与众多制造企业节能减排、提高资源利用率的转型需求恰好匹配。另一方面,佛山拥有完备的制造产业链和产品品类,本身也构成了环保加工业的一环,环保企业的一些仪器设备需要“佛山制造”的支持。 尽管环保产业是个战略新兴产业,备受重视,在插上互联网的翅膀后,该产业更具有了一定的战略前瞻性。但正如前面所提到,环保行业的规范要求不断在调整,新的环保法律法规的涌现都会成为行业的影响因素。正因如此,目前互联网+环保领域还没有出现占据垄断或绝对主导地位的企业。而这,也给了佛山环保企业一个突破的机会。 佛山制造业经历的大变革,不仅可以让环保成为产业转型升级的抓手,更可以壮大一批环保企业,推动它们成长为互联网+环保产业规则的制定者。 当然,佛山传统环保企业拥抱互联网,在真正壮大前,要解决不少难题。首先就是大数据。这一新生产要素也正是环境服务的核心。 以长天思源为例,我们在环保物联网方面深耕16年,依托云计算、物联网、大数据,实现环保管理全业务应用体系集成,涵盖污染源在线监控系统、VOC在线监测系统、环境第三方检测等业务。其中,数据是一切业务的基础。比如我们研发的佛山污染源在线监测系统项目,它提供了环保体系的基础数据,排污权、水权、碳排放权交易和环境金融,都能以它为依据去开展,我们借数据之力将该项目打造成环保产业的“中枢神经”。 然而如何进一步提升大数据的应用和服务价值,成了摆在环保企业面前的难题。尽管长天思源在这一领域探索多年,也仍有不少功课需要补。不少企业已经有意识地开始建立自己的“数据王国”,对他们来说强化数据应用的难点不在于技术层面,而在于认识和观念层面。后工业时代,企业的价值不仅体现在产品上,更体现在服务上。我们可以和一些专业大数据公司合作开发系统、建模、创立数据库,但若不懂如何运用数据服务客户,让数据增值,那么拥有以上这些技术工具也是徒劳。也就是说,挖到数据,递给客户,但如果不了解这其中能解决什么问题,企业的服务价值便大打折扣。 因此,对于佛山企业来说,最需要改变的是学会反向思考。把此前从技术端出发看问题的思维,转化为从用户的价值端寻找潜在需求。比如,根据环保污染物指标的改变提供相应的数据和监测服务。总之,智能化的数据分析、服务和模式的创新是佛企急需修炼的“内功”。 目前,包括佛山在内,全国环保产业市场化水平较低,企业服务模式较落后,加之政府环境数据的公开才起步不久,互联网+环保的产业拼图还有很大完善空间。在这种情况下,佛山要把握住在该领域出头机会。佛企要强化服务意识,政府应优化技术层面的产学研环境,共同培育大数据、环境跨界方面人才,多方努力共同擦亮佛山的互联网+环保产业品牌。 本文转自d1net(转载)

资源下载

更多资源
Mario

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长,特征是大鼻子、头戴帽子、身穿背带裤,还留着胡子。与他的双胞胎兄弟路易基一起,长年担任任天堂的招牌角色。

腾讯云软件源

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题,腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构,目前腾讯云软件源站支持公网访问和内网访问。

Nacos

Nacos

Nacos /nɑ:kəʊs/ 是 Dynamic Naming and Configuration Service 的首字母简称,一个易于构建 AI Agent 应用的动态服务发现、配置管理和AI智能体管理平台。Nacos 致力于帮助您发现、配置和管理微服务及AI智能体应用。Nacos 提供了一组简单易用的特性集,帮助您快速实现动态服务发现、服务配置、服务元数据、流量管理。Nacos 帮助您更敏捷和容易地构建、交付和管理微服务平台。

WebStorm

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源,继承了IntelliJ IDEA强大的JS部分的功能。

用户登录
用户注册