和我一起入门python爬虫-低调大师

和我一起入门python爬虫

2019-03-19 850

前几天就想写一个爬虫系列的文章，因为比较忙所以没有写（还不是因为懒），趁着现在屋里比较的凉爽，心也比较的静，总结下目前遇到的一些爬虫知识，本系列将从简单的爬虫开始说起，后会逐渐的提升难度，同时会对反爬手段做一个总结，以及用具体的事例来演示，不同的反爬现象和实现手段。

前言

本系列侧重点是应用和实战，所以，对于软件的安装这些基本操作不做详细讲解，我这里认为你已经有了一定的python基础，所以对于python的安装一定会有一定的了解了，这里废话不多说让我们进入正题。

环境准备

鉴于大多数人的系统是windows系统，所以这里的所有内容都是在Windows下进行的，另外推荐安装谷歌浏览器，使用语言python，版本3.6(低版本不能使用requests_html)。主要的爬虫模块requests_html。

爬虫具备的基本条件

作为一个合格的爬虫，首先得有一个headers,如何理解headers，我们打开谷歌浏览器，然后F12,选择network选项卡，打开百度的首页,然后打开然后选择其中的一个链接，然后点击新弹出的窗口的headers,看到有一个'Request Headers'，我们看到下面红框的内容，这些由:组成的数据结构，共同构成了一个headers，在python中可以把这些字段作为一个字典传入。

爬虫的代码实现

下面我来看一个基本爬虫代码，爬取百度的导航栏文字内容。
1.导入requests_html模块。

from requests_html import HTMLSession

2.创建一给session对象，目的是维持一次完整的会话。

session=HTMLSession()

3.通过get方法访问网络

url='https://www.baidu.com'
headers={'User-Agent':'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/67.0.3396.62 Safari/537.36'}
req=session.get(url=url,headers=headers)

get方法需要传入两个参数，一个是url，一个是headers(字典类型)。一般的我们传入一个user_agent就可以愉快的使用了。(这里只是说一般的对于有先网站服务器还会监测headers的其他属性内容)。我们会获取一个response对象。

拓展:如果查看requests_html的源码会发现默认是给了几个headers属性的。

def default_headers():

    """

    :rtype: requests.structures.CaseInsensitiveDict

    """

    return CaseInsensitiveDict({

        'User-Agent': default_user_agent(),  #这个就是一个随机的useragent

        'Accept-Encoding': ', '.join(('gzip', 'deflate')),#接收编码类型

        'Accept': '*/*',#接收文件类型

        'Connection': 'keep-alive',#保持链接

    })

4.获取网页返回的状态码
一般的我们把200状态码认为是响应成功(并不一定是你想要的结果，比如登陆失败有些也是200)。
其他常见的还有，404网页访问失败，500服务器拒绝访问,302和301作为网页的重定向。

if req.status_code==200:

   print("ok")

5.获取正确的网页编码
因为每个页面的编码不同，可能导致在解析的时候出现乱码的情况，对此requests_html模块为我们提供了一个可以高准确率获取编码的方法，目前来看对于绝大对数html页面是没有问题的,所以可以放心使用。

req.encoding=req.apparent_encoding

6.查看获取html源码
此时我们已经获取了编码之后的对象了，如果我们需要查看获取的内容以及编码是否正确我们可以使用text属性来获取网页的源码，它是一个字符串格式的。
7.xpath表达式的使用
requets_html模块的一个好处就是集合了众多的网页解析模块比如，bs4,pyquery,lxml等，可以说相当的强大了，requests_html通过response的html属性调用xpath方法，来直接操作dom对象，通过观察我们获取百度导航栏的标题的xpath,代码我们可以这样写。

 node_list=req.html.xpath("//div[@id='u1']/a/text()")

简单说下上面xpath表达式的含义，//从匹配选择的当前节点选择文档中的节点，而不考虑它们的位置。/表示从根节点选取。后面跟的ediv表示是div节点，中括号里面一般是做属性判断@id就是判断id属性然后取其值为ul的，后面紧跟的/a,表示上面div节点的下级所有含有a的节点,然后后面的text()是表示获取该节点的文本信息。
8.综合整理下上面的代码如下:

from requests_html import HTMLSession

from traceback import format_exc
class BaiDu():

   def __init__(self):

       self.session=HTMLSession()

       self.url='https://www.baidu.com'

       self.headers={'User-Agent':'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/67.0.3396.62 Safari/537.36'}

       self.timeout=20

   def gethtml(self):

       try:

           req=self.session.get(url=self.url,headers=self.headers,timeout=self.timeout)

           if req.status_code==200:

               req.encoding=req.apparent_encoding

               title_info=self.parse_html(req)

               return ' | '.join(title_info)

       except:

           print("出错了错误内容是",format_exc)



   def parse_html(self,req):

       node_list=req.html.xpath("//div[@id='u1']/a/text()")

       return node_list
if __name__ == '__main__':

        baidu=BaiDu()

        title=baidu.gethtml()

        print(title)

输出结果:

新闻 | hao123 | 地图 | 视频 | 贴吧 | 学术 | 登录 | 设置 | 更多产品

好了，今天的内容就到这，内容比较的简单，简单的说了下爬虫的基本思路，后面会一步步加大难度，如有任何问题和疑问欢迎留言，如果您喜欢我的文章不防动动小手，转发到朋友圈分享给更多的朋友。

微信关注我们

原文链接：https://yq.aliyun.com/articles/694471

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

javascript反混淆之packed混淆（一）

javascript反混淆之packed混淆（一）什么是JavaScript反混淆，在理解这个概念前我们先来看下什么是代码混淆,代码混淆，是将计算机程序的代码，转换成一种功能上等价，但是难于阅读和理解的形式的行为。所以JavaScript反混淆就是为了破解这种难以理解的js代码的。混淆有很多种格式目前我接触最多的就是packed混淆。什么是packed混淆我们首先我们来看一段代码 eval(function(p,a,c,k,e,d){e=function(c){return(c<a?"":e(parseInt(c/a)))+((c=c%a)>35?String.fromCharCode(c+29):c.toString(36))};if(!''.replace(/^/,String)){while(c--)d[e(c)]=k[c]||e(c);k=[function(e){return d[e]}];e=function(){return'\\w+'};c=1;};while(c--)if(k[c])p=p.replace(new RegExp('\\b'+e(c)...

2019-03-19

710

__dict__ __dict__是用来存储对象属性的一个字典，其键为属性名，值为属性的值。既然__dict__是个字典那么我们就可以用字典的属性了。我们通过使用dir()属性来看看__dict__都有哪些属性。 ['__class__', '__contains__', '__delattr__', '__delitem__', '__dir__', '__doc__', '__eq__', '__format__', '__ge__', '__getattribute__', '__getitem__', '__gt__', '__hash__', '__init__', '__init_subclass__', '__iter__', '__le__', '__len__', '__lt__', '__ne__', '__new__', '__reduce__', '__reduce_ex__', '__repr__', '__setattr__', '__setitem__', '__sizeof__', '__str__', '__subclasshook__', 'cl...

2019-03-19

860

资源下载

更多资源

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长，特征是大鼻子、头戴帽子、身穿背带裤，还留着胡子。与他的双胞胎兄弟路易基一起，长年担任任天堂的招牌角色。

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题，腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构，目前腾讯云软件源站支持公网访问和内网访问。

Spring

Spring框架（Spring Framework）是由Rod Johnson于2002年提出的开源Java企业级应用框架，旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念，提供核心容器、应用上下文、数据访问集成等模块，支持整合Hibernate、Struts等第三方框架，其适用范围不仅限于服务器端开发，绝大多数Java应用均可从中受益。

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能，例如代码缩略图，Python的插件，代码段等。还可自定义键绑定，菜单和工具栏。Sublime Text 的主要功能包括：拼写检查，书签，完整的 Python API ， Goto 功能，即时项目切换，多选择，多窗口等等。Sublime Text 是一个跨平台的编辑器，同时支持Windows、Linux、Mac OS X等操作系统。