python爬虫爬取豆瓣电影-低调大师

python爬虫爬取豆瓣电影

2018-06-28 708

最近买了《python编程从入门到实践》，想之后写两篇文章，一篇数据可视化，一篇python web，今天这篇就当python入门吧。

一.前期准备:

IDE准备:pycharm
导入的python库：requests用于请求，BeautifulSoup用于网页解析

二.实现步骤

1.传入url

2.解析返回的数据

3.筛选

4.遍历提取数据

三.代码实现

import requests # 导入网页请求库
from bs4 import BeautifulSoup # 导入网页解析库

# 传入URL
r = requests.get("https://movie.douban.com/top250")

# 解析返回的数据
soup=BeautifulSoup(r.content,"html.parser")

#找到div中，class属性为item的div
movie_list=soup.find_all("div",class_="item")

#遍历提取数据
for movie in movie_list:
    title=movie.find("span",class_="title").text
    rating_num=movie.find("span",class_="rating_num").text
    inq=movie.find("span",class_="inq").text
    star = movie.find('div', class_='star')
    comment_num = star.find_all('span')[-1].text
    print(title, rating_num, '\n', comment_num, inq, '\n')

以title变量为例，我们找到了div中，class属性为item的div，然后在此div中，筛选出class名为title的span，获取文本内容，打印（comment_num比较特殊，因为其在star的div下，没有class属性，为div中最后一个span，所以我们取出star层级中最后一个span，变为文本），以下是输出结果。

img_446cb68535aaad97f1c6783f594a6b25.jpe

豆瓣.JPG

四.对获取到的数据进行整合

1.整合成列表

2.整合成json文件

3.定义为函数形式

1.整合成列表

import requests # 导入网页请求库
from bs4 import BeautifulSoup # 导入网页解析库
import pprint # 规范显示列表的插件库

# 传入URL
r = requests.get("https://movie.douban.com/top250")

# 解析返回的数据
soup=BeautifulSoup(r.content,"html.parser")

#找到div中，class属性为item的div
movie_list=soup.find_all("div",class_="item")

#创建存储结果的空列表
result_list=[]

#遍历提取数据
for movie in movie_list:
    #创建字典
    dict={}
    dict["title"]=movie.find("span",class_="title").text
    dict["dictrating_num"]=movie.find("span",class_="rating_num").text
    dict["inq"]=movie.find("span",class_="inq").text
    star = movie.find('div', class_='star')
    dict["comment_num"] = star.find_all('span')[-1].text
    result_list.append(dict)

    # 显示结果
pp = pprint.PrettyPrinter(indent=4)
pp.pprint(result_list)

控制台显示的结果:

img_fd2531c8a9777b90c52e02837bd96684.jpe

列表.JPG

2.整合成JSON文件

import requests # 导入网页请求库
import json# 用于将列表字典（json格式）转化为相同形式字符串，以便存入文件
from bs4 import BeautifulSoup # 导入网页解析库


# 传入URL
r = requests.get("https://movie.douban.com/top250")

# 解析返回的数据
soup=BeautifulSoup(r.content,"html.parser")

#找到div中，class属性为item的div
movie_list=soup.find_all("div",class_="item")

#创建存储结果的空列表
result_list=[]

#遍历提取数据
for movie in movie_list:
    #创建字典
    dict={}
    dict["title"]=movie.find("span",class_="title").text
    dict["dictrating_num"]=movie.find("span",class_="rating_num").text
    dict["inq"]=movie.find("span",class_="inq").text
    star = movie.find('div', class_='star')
    dict["comment_num"] = star.find_all('span')[-1].text
    result_list.append(dict)

    # 显示结果
# 将result_list这个json格式的python对象转化为字符串
s = json.dumps(result_list, indent = 4, ensure_ascii=False)
# 将字符串写入文件
with open('movies.json', 'w', encoding = 'utf-8') as f:
    f.write(s)

结果:

img_03658bb7b89f70ac9020280f7b597ad5.jpe

json.JPG

3.定义成函数

import requests # 导入网页请求库
import json# 用于将列表字典（json格式）转化为相同形式字符串，以便存入文件
from bs4 import BeautifulSoup # 导入网页解析库

# 用于发送请求，获得网页源代码以供解析
def start_requests(url):
    r = requests.get(url)
    return r.content

# 解析返回的数据
def parse(text):
    soup=BeautifulSoup(text,"html.parser")
    movie_list=soup.find_all("div",class_="item")
    result_list=[]
    for movie in movie_list:
    #创建字典
        dict={}
        dict["title"]=movie.find("span",class_="title").text
        dict["dictrating_num"]=movie.find("span",class_="rating_num").text
        dict["inq"]=movie.find("span",class_="inq").text
        star = movie.find('div', class_='star')
        dict["comment_num"] = star.find_all('span')[-1].text
        result_list.append(dict)
    return result_list

    #将数据写入json文件
def write_json(result):
    s = json.dumps(result, indent = 4, ensure_ascii=False)
    with open('movies1.json', 'w', encoding = 'utf-8') as f:
        f.write(s)

# 主运行函数，调用其他函数
def main():
    url = 'https://movie.douban.com/top250'
    text = start_requests(url)
    result = parse(text)
    write_json(result)

if __name__ == '__main__':
    main()

结果:

img_c6a3657cae5ef019047d9cafaadcc8b7.jpe

函数.JPG

觉得有用的话就给颗小吧~

微信关注我们

原文链接：https://yq.aliyun.com/articles/656122

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

Invalid or corrupt jarfile坑爹问题解决

打包一个可以直接利用java-jar jarcvfmlottery.jarMANIFEST.MFjdbc.propertiescom 如果出现： java.io.IOException:invalidheaderfield这样的错误的话，就说明MANIFEST.MF文件有问题，比如写成了这样：Manifest-Version:1.0Main-Class:com.feishan.lottery.view.Index Class-Path:jar/jdbc_feishan.jarjar/mysql5.0.3.jar 或者如果觉得打的可运行jar包那里都是对的，但执行java -jarlottery.jar 或者 java -cplottery.jarcom.test.Test 怎么运行都是Invalid or corrupt jarfile 要么就是Could not find or load main class 那么99%绝对是MANIFEST.MF文件有问题注意： Main-Class:后面应该有一个空格 Manifest-Version:1.0 Main-Class:com.fe...

2018-06-29

3777

Python_Django2.1配置开发环境

很久之前就想建立一个属于自己的博客，但这个计划一直处在搁置的状态，在大二上学期也学过一点网页设计的皮毛，只做了几个简单的网页，就没有继续做下去了，直到接触了Python，并了解到其Django框架的强大功能，便又萌生出建立个人博客的念头，也买了相应的书，并找了网易云的Django入门教程，计划在暑假完成这个项目，好了，废话说到这，让我们来开始第一步，配置开发环境！ 0.开发环境 Python3.6.5 Pycharm-2018.1.2 Win10 Django2.0.6 1.下载Django cmd输入pip install Django下载Django 输入python -m django --version查看django版本 2.创建开发文件夹 1，在你想要创建的目录下打开cmd，后续一直需要用到这个小技巧！比如在E盘下创建输入djangp-admin startproject myblog创建名为“myblog”的文件夹 2，打开myblog文件夹，再次在搜索栏中输入cmd 输入python manage.py startapp blog命令 3.制作hello，world...

2018-06-29

561

资源下载

更多资源

优质分享Android(本站安卓app)

近一个月的开发和优化，本站点的第一个app全新上线。该app采用极致压缩，本体才4.36MB。系统里面做了大量数据访问、缓存优化。方便用户在手机上查看文章。后续会推出HarmonyOS的适配版本。

Apache Tomcat7、8、9（Java Web服务器）

Tomcat是Apache 软件基金会（Apache Software Foundation）的Jakarta 项目中的一个核心项目，由Apache、Sun 和其他一些公司及个人共同开发而成。因为Tomcat 技术先进、性能稳定，而且免费，因而深受Java 爱好者的喜爱并得到了部分软件开发商的认可，成为目前比较流行的Web 应用服务器。

Java Development Kit(Java开发工具)

JDK是 Java 语言的软件开发工具包，主要用于移动设备、嵌入式设备上的java应用程序。JDK是整个java开发的核心，它包含了JAVA的运行环境（JVM+Java系统类库）和JAVA工具。

Sublime Text 一个代码编辑器

Sublime Text具有漂亮的用户界面和强大的功能，例如代码缩略图，Python的插件，代码段等。还可自定义键绑定，菜单和工具栏。Sublime Text 的主要功能包括：拼写检查，书签，完整的 Python API ， Goto 功能，即时项目切换，多选择，多窗口等等。Sublime Text 是一个跨平台的编辑器，同时支持Windows、Linux、Mac OS X等操作系统。