基于python的Scrapy爬虫框架实战

2018-07-18 606

基于python的Scrapy爬虫框架实战

2018年7月19日笔记

1.伯乐在线

网站页面如下图所示：

网站页面.png

1.1 新建爬虫工程

命令：scrapy startproject BoleArticle

新建爬虫工程命令

命令： scrapy genspider article "blog.jobbole.com"
注意：运行此命令时必须在爬虫工程文件夹内，如下图路径所示。

新建爬虫文件命令

1.2 编辑items.py文件

6个字段:title、publishTime、category、digest、detailUrl、img_url，数据类型为scrapy.Field对象

import scrapy
from scrapy import Field

class BolearticleItem(scrapy.Item):
    title = Field()
    publishTime = Field()
    category = Field()
    digest = Field()
    detailUrl = Field()
    img_url =Field()

1.3 编辑article.py文件

parse函数用于解析最大共有多少页，并将每一个目录页面的链接通过字符串拼接的方法传给下一级解析函数
scrapy.Request函数里面有2个参数：第1个参数数据类型是字符串，是下一级解析页面的url链接；
第2个参数数据类型是函数对象，是ArticleSpider里面函数的函数名。
parse1函数用于解析每一个目录页面的文章信息，共有6个字段:title、publishTime、category、digest、detailUrl、img_url，publishTime字段是通过正则表达式找到的，具体是使用re.search方法。其他字段通过xpath可以找到。

import scrapy
from ..items import BolearticleItem
import re

class ArticleSpider(scrapy.Spider):
    name = 'article'
    allowed_domains = ['blog.jobbole.com']
    start_urls = ['http://blog.jobbole.com/all-posts/']

    def parse(self, response):
        pageNum = response.xpath("//a[@class='page-numbers']/text()")[-1].extract()
        for i in range(1,int(pageNum)+1):
            url = "http://blog.jobbole.com/all-posts/page/{}/".format(i)
            yield scrapy.Request(url,callback=self.parse1)

    def parse1(self,response):
        def find(xpath, pNode=response):
            if len(pNode.xpath(xpath)):
                return pNode.xpath(xpath).extract()[0]
            else:
                return ''
        article_list = response.xpath("//div[@class='post floated-thumb']")
        for article in article_list:
            item = BolearticleItem()
            item['title'] = find("div[1]/a/@title",article)
            pTagStr = find("div[2]/p",article)
            item['publishTime'] = re.search("\d+/\d+/\d+",pTagStr).group(0)
            item['category'] = find("div[2]/p/a[2]/text()",article)
            item['digest'] = find("div[2]/span/p/text()",article)
            item['detailUrl'] = find("div[2]/p/a[1]/@href",article)
            item['img_url'] = find("div[1]/a/img/@src",article)
            yield item

1.4 编辑pipelines.py文件

在管道类初始化时，删除并新建表article1
下面一段代码中有2处需要修改：1.数据库名，第4行的变量database；2.数据库连接的密码，第8行的变量passwd
代码第28行变量insert_sql的数据类型是字符串，通过字符串拼接形成插入数据的sql语句。
理解变量fieldStr、valueStr形成过程的难点是字符串的join方法和推导式
每次插入数据后都执行self.conn.commit()

import pymysql
from time import time

def getConn(database ="bolearticle"):
    args = dict(
        host = 'localhost',
        user = 'root',
        passwd = '... your password',
        charset = 'utf8',
        db = database
    )
    return pymysql.connect(**args)

class BolearticlePipeline(object):
    startTime = time()
    conn = getConn()
    cursor = conn.cursor()
    drop_sql = "drop table if exists article1"
    cursor.execute(drop_sql)
    create_sql = "create table article1(title varchar(200) primary key,publishtime varchar(30)," \
                 "category varchar(30),digest varchar(500)," \
                 "detailUrl varchar(200),img_url varchar(200));"
    cursor.execute(create_sql)

    def process_item(self, item, spider):
        fieldStr = ','.join(['`%s`'%k for k in item.keys()])
        valuesStr = ','.join(['"%s"'%v for v in item.values()])
        insert_sql = "insert into article1(%s) values(%s)" %(fieldStr,valuesStr)
        self.cursor.execute(insert_sql)
        self.conn.commit()
        return item

1.5 编辑settings.py文件

关键点是最后3行要开启管道，CONCURRENT_REQUESTS变量设置为96能够较好利用多线程性能
ROBOTSTXT_OBEY设置为False,意思是不遵守爬虫协议，也称机器人协议。如果设置为True，即遵守爬虫协议，则可能访问受限。

BOT_NAME = 'BoleArticle'
SPIDER_MODULES = ['BoleArticle.spiders']
NEWSPIDER_MODULE = 'BoleArticle.spiders'
ROBOTSTXT_OBEY = False
CONCURRENT_REQUESTS = 96
ITEM_PIPELINES = {
   'BoleArticle.pipelines.BolearticlePipeline': 300,
}

1.6 运行结果

在命令行中运行命令：scrapy crawl article
查看数据库，结果截图如下：

图片.png-117.4kB

2.网易新闻图片

网址：http://news.163.com/special/photo-search/#q=%E4%B8%AD%E5%9B%BD
用urllib.parse.unquote方法查看%E4%B8%AD%E5%9B%BD的中文对应字符，如下图所示：

图片.png-3.8kB

网站页面如下图所示，需要爬取2400张图片：

图片.png-2954.8kB

2.1 新建爬虫工程

新建爬虫工程命令：scrapy startproject NeteasyImage
进入爬虫工程文件夹：cd .\NeteasyImage
新建爬虫文件命令：scrapy genspider image "news.163.com"

2.2 编辑items.py文件

3个字段：id、img_url、img_title

import scrapy
from scrapy import Field

class NeteasyimageItem(scrapy.Item):
    id = Field()
    img_url = Field()
    img_title = Field()

2.3 编辑image.py文件

image_number变量是下载图片的数量。
start_urls变量数据类型为列表，其中的每个元素的数据类型为字符串，是获取图片链接的请求url。
start_urls中的元素发出请求返回的内容为json类型的文本。
json.loads方法中有1个参数，参数数据类型为字符串，这个方法的作用可以把字符串转为字典，要求字符串必须以{开头，以}结束。
对于下图的json文本来说，需要删除左边的var jsonres=,删除最后一个字符;
转化后的字典赋值给jsonLoad变量，jsonLoad['hits']数据类型为列表，当中有图片的链接，标题等。
id字段用来判断是第几张图。

图片.png-111.3kB

import scrapy
import json
from ..items import NeteasyimageItem
class ImageSpider(scrapy.Spider):
    name = 'image'
    allowed_domains = ['netease.com']
    image_number = 2000
    urlBefore = "http://uvs.youdao.com/search?site=photogalaxy.163.com" \
                "&sort=time&channelid=&q=%E4%B8%AD%E5%9B%BD&length=100&start={}"
    start_urls = []
    for i in range(0, image_number, 100):
        start_urls.append(urlBefore.format(i))
    count = 0
    def parse(self, response):
        jsonStr = response.text.lstrip("var jsonres=").strip().strip(";")
        jsonLoad = json.loads(jsonStr)
        for image in jsonLoad['hits']:
            self.count += 1
            item = NeteasyimageItem()
            item['id'] = self.count
            item['img_title'] = image['setname']
            item['img_url'] = image['imgsrc']
            yield item

2.4 编辑settings.py文件

关键点是最后3行要开启管道，CONCURRENT_REQUESTS变量设置为96能够较好利用多线程性能
ROBOTSTXT_OBEY设置为False,意思是不遵守爬虫协议，也称机器人协议。如果设置为True，即遵守爬虫协议，则可能访问受限。

import os
BOT_NAME = 'NeteasyImage'
SPIDER_MODULES = ['NeteasyImage.spiders']
NEWSPIDER_MODULE = 'NeteasyImage.spiders'
ROBOTSTXT_OBEY = False
CONCURRENT_REQUESTS = 96
CONCURRENT_ITEMS = 200
IMAGES_STORE = os.getcwd() + '/images/'
ITEM_PIPELINES = {
   'NeteasyImage.pipelines.NeteasyimagePipeline': 300,
}

2.5 编辑pipelines.py文件

下面代码比较难懂的地方是item_completed函数中的results参数
results数据类型为列表，列表中的第一个元素为元组，元组中第一个元素result[0][0]数据类型为布尔，是下载结果是否成功。
result[0][1]是下载图片返回的一些信息，数据类型为字典，其中有3个键值对，3个键为url、path、checksum。格式如下所示。
{'url': 'http://img2.cache.netease.com/photo/0003/2016-07-18/t_BS95B1C900AJ0003.jpg', 'path':
'full/98979c89e2b5e6ef9926183dab4e8bf5a8efa8a4.jpg', 'checksum': '15d5231fcd77d81ddd58d7db6a07c1ce'}
url是下载图片的链接，path是下载图片保存的路径，checksum是下载图片的文件校验和。
用os.rename方法重命名图片文件。

from scrapy.pipelines.images import ImagesPipeline
import scrapy
from .settings import IMAGES_STORE as images_store
import os

class NeteasyimagePipeline(ImagesPipeline):
    def get_media_requests(self, item, info):
        yield scrapy.Request(item['img_url'])
    def item_completed(self, results, item, info):
        if results[0][0]:
            old_path = images_store + results[0][1]['path']
            fileName = "{}-{}.jpg".format(item['id'],item['img_title'])
            new_path = images_store + fileName
            os.rename(old_path,new_path)

2.6 运行结果

在命令行中运行命令：scrapy crawl image
查看图片保存的文件夹，如下图所示：

图片.png-641.4kB

微信关注我们

原文链接：https://yq.aliyun.com/articles/649230

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

7月19日云栖精选夜读丨你的灵魂画作都去哪儿了？“猜画小歌”背后的5000万组数据

自从退出中国的搜索引擎市场，谷歌大概无时不刻都想”卷土重来“。昨天，这家以搜索引擎著称的巨头公司用一款微信小程序“猜画小歌”占领了朋友圈“C位”，刷足存在感的同时，还顺便激发了身边一票“灵魂画手”。热点热议你的灵魂画作都去哪儿了？“猜画小歌”背后的5000万组数据作者：技术小能手发表在：大数据文摘人人都能做人工智能专家！阿里云发布智能语音自学习平台作者：云攻略小攻发表在：云攻略马斯克联名2000多AI专家誓言禁绝杀人机器人！发起人泰格马克将亲临AI World2018 作者：技术小能手发表在：新智元知识整理 WebFlux基础之响应式编程作者：融科聂晨 Spark性能优化：数据倾斜调优作者： citibank 手把手教你 vue-cli 单页到多页应用作者： a独家记忆发表在：前端那些事儿手写spring+springmvc+mybatis框架篇作者：技术小能手发表在： Java知音 Android - 条纹进度条实现，调整view宽度仿进度条作者： rustfisher 美文回顾剖析nodejs的事件循环作者： a独家记...

2018-07-18

747

使用Sublime text 3打造一个小巧但强大的Go语言开发IDE 最近在学习GO语言，网上找了一下GO语言的IDE，发现GO语言目前没有一个专业的IDE，都是一些各种插件来实现的，由于go的特性：开发过程中需要设置GOPATH 用到第三方的包又要使用go get 运行的时候要用go run 打包的要使用go install 交叉编译的时候还要配置GOARCH GOOS go build 试了很多朋友分享的工具都很不好用，试用了一下Jetbrains的Goland Early build version，发现很多Bug，没有交叉编译，无法go get，并不能满足开发、打包、分发的需求，不过Goland的代码提示还是特别棒的，希望以后正式版能够做的更好。打造自己的Go语言开发IDE 好了废话不多说，来开始动手打造一个强大的Go语言开发IDE，强大到什么程度，自己体会吧：支持自动配置GOPATH 支持简单的go run 支持go get 支持go install 当然也支持 “交叉编译” 而且还支持go test go clean 下载并安装 sublime text 3 sub...

2018-07-18

696

资源下载

更多资源

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长，特征是大鼻子、头戴帽子、身穿背带裤，还留着胡子。与他的双胞胎兄弟路易基一起，长年担任任天堂的招牌角色。

Nacos

Nacos /nɑ:kəʊs/ 是 Dynamic Naming and Configuration Service 的首字母简称，一个易于构建 AI Agent 应用的动态服务发现、配置管理和AI智能体管理平台。Nacos 致力于帮助您发现、配置和管理微服务及AI智能体应用。Nacos 提供了一组简单易用的特性集，帮助您快速实现动态服务发现、服务配置、服务元数据、流量管理。Nacos 帮助您更敏捷和容易地构建、交付和管理微服务平台。

Spring

Spring框架（Spring Framework）是由Rod Johnson于2002年提出的开源Java企业级应用框架，旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念，提供核心容器、应用上下文、数据访问集成等模块，支持整合Hibernate、Struts等第三方框架，其适用范围不仅限于服务器端开发，绝大多数Java应用均可从中受益。

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能，例如代码缩略图，Python的插件，代码段等。还可自定义键绑定，菜单和工具栏。Sublime Text 的主要功能包括：拼写检查，书签，完整的 Python API ， Goto 功能，即时项目切换，多选择，多窗口等等。Sublime Text 是一个跨平台的编辑器，同时支持Windows、Linux、Mac OS X等操作系统。