Python爬虫入门教程 12-100 半次元COS图爬取

2019-04-23 511

写在前面

今天在浏览网站的时候，忽然一个莫名的链接指引着我跳转到了半次元网站 https://bcy.net/ 打开之后，发现也没有什么有意思的内容，职业的敏感让我瞬间联想到了 cosplay ，这种网站必然会有这个的存在啊，于是乎，我准备好我的大爬虫了。

把上面的链接打开之后，被我发现了吧，就知道我的第八感不错滴。接下来就是找入口，一定要找到图片链接的入口才可以做下面的操作

这个页面不断往下拖拽，页面会一直加载，当时当你拖拽一会，就停下来了，就是这个时机

发现入口，在我实际的操作中，其实还发现了很多其他的入口，这个就不一一的解释了，赶紧上车，进入 view more 之后，发现了页面依旧是一个下拉刷新的布局方式，专业术语 瀑布流 。

python爬虫第一步

打开开发者工具，切换到network之后，发现很多xhr请求，发现这个，就代表这个网站很容易爬取了

提取待爬取的链接，分析规律

https://bcy.net/circle/timeline/loadtag?since=0&grid_type=timeline&tag_id=1482&sort=hot
https://bcy.net/circle/timeline/loadtag?since=26499.779&grid_type=timeline&tag_id=1482&sort=hot
https://bcy.net/circle/timeline/loadtag?since=26497.945&grid_type=timeline&tag_id=1482&sort=hot

发现只有一个参数在变，而且这变化好像没有任何规律可以寻找，没事，看数据，你就可以发现其中的奥妙了

这个网站的原理很简单，就是通过不断获取每次数据的最后一条的since然后获取接下来的数据，那么我们按照它的规律实现代码就可以了，不要多线程了，这种规律是没有办法进行实操的。
这次的数据我把它存储到mongodb里面，因为没有办法一次全部获取到，所以可能需要下次在继续使用

if __name__ == '__main__':
    ###  mongodb 的一些基本操作   
    DATABASE_IP = '127.0.0.1'
    DATABASE_PORT = 27017
    DATABASE_NAME = 'sun'
    start_url = "https://bcy.net/circle/timeline/loadtag?since={}&grid_type=timeline&tag_id=399&sort=recent"
    client = MongoClient(DATABASE_IP, DATABASE_PORT)

    db = client.sun
    db.authenticate("dba", "dba")
    collection  =  db.bcy  # 准备插入数据
    #####################################3333
    get_data(start_url,collection)

获取网页数据这个地方，由我们前面的经验就变得很简单了

# 获取数据函数  
def get_data(start_url,collection):
    since = 0
    while 1:
        try:
            with requests.Session() as s:
                response = s.get(start_url.format(str(since)),headers=headers,timeout=3)
                res_data = response.json()
                if res_data["status"] == 1:
                    data = res_data["data"]  # 获取Data数组
                    time.sleep(0.5)
                ## 数据处理
                since = data[-1]["since"]  # 获取20条数据的最后一条json数据中的since
                ret = json_handle(data)   # 代码实现在下面
                try:
                    print(ret)
                    collection.insert_many(ret)   # 批量出入数据库
                    print("上述数据插入成功！！！！！！！！")
                except Exception as e:
                    print("插入失败")
                    print(ret)

                ##
        except Exception as e:
            print("!",end="异常，请注意")
            print(e,end=" ")
    else:
        print("循环完毕")

网页解析代码

# 对JSON数据进行处理
def json_handle(data):
    # 提取关键数据
    list_infos = []
    for item in data:
        item = item["item_detail"]
        try:
            avatar = item["avatar"] # 用户头像
            item_id = item["item_id"] # 图片详情页面
            like_count = item["like_count"] # 喜欢数目
            pic_num = item["pic_num"] if "pic_num" in item else 0 # 图片总数
            reply_count =item["reply_count"]
            share_count =item["share_count"]
            uid = item["uid"]
            plain = item["plain"]
            uname = item["uname"]
            list_infos.append({"avatar":avatar,
                               "item_id":item_id,
                               "like_count":like_count,
                               "pic_num":pic_num,
                               "reply_count":reply_count,
                               "share_count":share_count,
                               "uid":uid,
                               "plain":plain,
                               "uname":uname})
        except Exception as e:
            print(e)
            continue
        return list_infos

到现在就实现了，代码跑起来

她专科学历
27岁从零开始学习c，c++，python编程语言
29岁编写百例教程
30岁掌握10种编程语言，
用自学的经历告诉你，学编程就找梦想橡皮擦

微信关注我们

原文链接：https://yq.aliyun.com/articles/699747

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

java开发之使用websocket实现web客户端与服务器之间的实时通讯

第一次写博客，有写的不好的地方欢迎大家指点。使用websocket实现web客户端与服务器之间的实时通讯。以下是个简单的demo。 import java.util.Date; public class WebSocketMessage { /** * 发送者ID */ private String senderId; /** * 接受者ID, 如果为0, 则发送给所有人 */ private String receiverId; /** * 会话内容 */ private String messageContent; /** * 发送时间 */ private Date sendTime; public String getSenderId() { return senderId; } public void setSenderId(String senderId) { this.senderId = senderId; } public String getReceiverId() { return receiverId; } public void setReceiverId(S...

2019-04-24

453

好程序员web前端培训分享javascript关联数组用法总结，有需要的朋友可以参考下。 Hash关联数组定义代码如下// 定义空数组myhash = { }// 直接定义数组myhash = {"key1":"val1","key2":"val2" }// 用Array 定义数组myhash = new Array();myhash["key1"] = "val1";myhash["key2"] = "val2"; 向Hash关联数组添加键值代码如下// 添加一个新键 newkey ，键值为 newvalmyhash[”newkey”] = “newval”; 删除Hash关联数组已有键值代码如下// 删除一个键 newkey ，同时，该键值对应的 newval 也就消失了。delete myhash[”newkey”]; 遍历Hash关联数组代码如下复制代码// 遍历整个hash 数组for (key in myhash) {val = myhash[key];} Hash关联数组简易使用示例代码如下例如：//这里主要是说明对于关联数组的遍历，首先定义一个数组：代码如下var...

2019-04-24

540

资源下载

更多资源

Oracle

Oracle Database，又名Oracle RDBMS，或简称Oracle。是甲骨文公司的一款关系数据库管理系统。它是在数据库领域一直处于领先地位的产品。可以说Oracle数据库系统是目前世界上流行的关系数据库管理系统，系统可移植性好、使用方便、功能强，适用于各类大、中、小、微机环境。它是一种高效率、可靠性好的、适应高吞吐量的数据库方案。

Apache Tomcat

Tomcat是Apache 软件基金会（Apache Software Foundation）的Jakarta 项目中的一个核心项目，由Apache、Sun 和其他一些公司及个人共同开发而成。因为Tomcat 技术先进、性能稳定，而且免费，因而深受Java 爱好者的喜爱并得到了部分软件开发商的认可，成为目前比较流行的Web 应用服务器。

Eclipse

Eclipse 是一个开放源代码的、基于Java的可扩展开发平台。就其本身而言，它只是一个框架和一组服务，用于通过插件组件构建开发环境。幸运的是，Eclipse 附带了一个标准的插件集，包括Java开发工具（Java Development Kit，JDK）。

JDK

JDK是 Java 语言的软件开发工具包，主要用于移动设备、嵌入式设备上的java应用程序。JDK是整个java开发的核心，它包含了JAVA的运行环境（JVM+Java系统类库）和JAVA工具。

Python爬虫入门教程 12-100 半次元COS图爬取

写在前面

python爬虫第一步

java开发之使用websocket实现web客户端与服务器之间的实时通讯

好程序员web前端培训分享javascript关联数组用法总结

相关文章

发表评论

资源下载

Oracle

Apache Tomcat

Eclipse

JDK

欢迎您！