Java爬虫之下载IMDB中Top250电影的图片
介绍
在博客:Scrapy爬虫(4)爬取豆瓣电影Top250图片中我们利用Python的爬虫框架Scrapy,将豆瓣电影Top250图片下载到自己电脑上。那么,在Java的爬虫的也可以下载图片吗?答案当然是肯定的!
在本次分享中,我们将利用Java的Jsoup包和FileUtils.copyURLToFile()函数来实现图片的下载。我们将会爬取IMDB中Top250电影的图片到自己电脑上,其网页截图如下:
思路
我们实现图片下载的爬虫思路如下:
- 利用Jsoup解析网页,得到电影图片的url和name
- 利用FileUtils.copyURLToFile()函数将图片下载到本地
准备
在本文程序中,除了Jsoup包外,还用到了commons-io包,其下载地址为:https://mvnrepository.com/artifact/org.apache.commons/commons-io ,我们主要利用该package中的FileUtils.copyURLToFile(). 读者需要下载这两个包,并将它们在Eclipse中加入到项目的路径中。
程序
本次分享的主要程序为ImageScraper.java,其完整代码如下:
package wikiScrape;
/* 本爬虫爬取http://www.imdb.cn/IMDB250/中Top250的图片
* 先利用Jsoup解析得到该网页中的图片的url
* 然后利用FileUtils.copyURLToFile()函数将图片下载到本地
*/
import java.io.*;
import java.net.*;
import java.util.Date;
import java.util.ArrayList;
import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.select.Elements;
import org.apache.commons.io.FileUtils;
public class ImageScraper {
public static void main(String[] args) {
Date d1 = new Date();
System.out.println("爬虫开始......");
// 爬取的网址列表,一共十个网页
ArrayList<String> urls = new ArrayList<String>();
urls.add("http://www.imdb.cn/IMDB250/");
for(int i=2; i<=10; i++) {
urls.add("http://www.imdb.cn/imdb250/"+ Integer.toString(i));
}
String dir = "E://log/"; // 图片储存目录
// 利用循环下载每个页面中的图片
for(String url: urls) {
int index = urls.indexOf(url)+1;
System.out.println("开始下载第"+index+"个网页中的图片...");
getPictures(url, dir);
System.out.println("第"+index+"个网页中的图片下载完毕!\n");
}
System.out.println("程序运行完毕!");
Date d2 = new Date();
// 计算程序的运行时间,并输出
long seconds = (d2.getTime()-d1.getTime())/1000;
System.out.println("一共用时: "+seconds+"秒.");
}
// getContent()函数: 将网页中的电影图片下载到本地
public static void getPictures(String url, String dir){
// 利用URL解析网址
URL urlObj = null;
try{
urlObj = new URL(url);
}
catch(MalformedURLException e){
System.out.println("The url was malformed!");
}
// URL连接
URLConnection urlCon = null;
try{
// 打开URL连接
urlCon = urlObj.openConnection();
// 将HTML内容解析成UTF-8格式
Document doc = Jsoup.parse(urlCon.getInputStream(), "utf-8", url);
// 提取电影图片所在的HTML代码块
Elements elems = doc.getElementsByClass("ss-3 clear");
Elements pic_block = elems.first().getElementsByTag("a");
for(int i=0; i<pic_block.size(); i++) {
// 提取电影图片的url, name
String picture_url = pic_block.get(i).getElementsByTag("img").attr("src");
String picture_name = pic_block.get(i).getElementsByClass("bb").text()+".jpg";
// 用download()函数将电影图片下载到本地
download(picture_url, dir, picture_name);
System.out.println("第"+(i+1)+"张图片下载完毕!");
}
}
catch(IOException e){
System.out.println("There was an error connecting to the URL");
}
}
// download()函数利用图片的url将图片下载到本地
public static void download(String url, String dir, String filename) {
try {
/* httpurl: 图片的url
* dirfile: 图片的储存目录
*/
URL httpurl = new URL(url);
File dirfile = new File(dir);
// 如果图片储存的目录不存在,则新建该目录
if (!dirfile.exists()) {
dirfile.mkdirs();
}
// 利用FileUtils.copyURLToFile()实现图片下载
FileUtils.copyURLToFile(httpurl, new File(dir+filename));
}
catch(Exception e) {
e.printStackTrace();
}
}
}
运行
运行以上程序,结果如下:
查看E盘中的log文件夹,内容如下:
一共下载了244张图片,用时140秒,有几张图片下载失败,效果还算OK.
本次分享就到此结束喽,欢迎大家交流~~

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。
持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。
转载内容版权归作者及来源网站所有,本站原创内容转载请注明来源。
-
上一篇
初学Python——第一节课
一、Python语言的特性: 1.与C语言不同,Python语言是一门解释性语言。程序在执行过程中,执行一步、编译一步。 2.Python是一个动态类型语言,不需要定义变量的数据类型。 3.Python是一门强类型语言。(如果定义了一个变量,如果不人为的强制类型转换,它永远都是开始的那种数据类型) 二、Python的优缺点: 优点:1.简单易懂,初学者很容易入门 2.开发效率高,具有强大的标准库和第三方库,大大降低开发周期,避免重复造轮子 3.高级语言,不用考虑内存一类的底层细节 4.有很强的可移植性、可扩展性和可嵌入性 当然,没有一门语言是完美的,它也有缺点: 1.运行速度慢,大多数情况下用户是感知不到的。相比C和JVAV来说,它确实慢一些,如果对速度要求很高,可以用其他语言去实现。 2.代码不能加密,源码是以明文形式存放的,当然这不一定是个缺点。如果需要源代码是加密的,可以不用这门语言来写。 3.线程不能利用多CPU的问题,Python的线程是操作系统的原生线程。 接下来是一些初步的学习,零散的知识: 1.Python的默认编码为UTF-8,而非ASCII(至少在Python3里)...
-
下一篇
Java 移位运算详解(2进制+原码+反码+补码)
一、参考 1、java高级之java的左移运算符和右移运算符 二、简述 1、定义: 符号 名称 实际操作 简单记忆 << 左移 2 进制左边补齐0位 乘以2的N次方 >> 右移 2 进制右边减少位数 除以2的N次方(其实并非如此,要舍去小数点) >>> 右移 2 进制右边0填充高位 除以2的N次方(其实并非如此,要舍去小数点) 2、速度:机器码是二进制01运算的,移位速度最快了 3、适用场景: 3.1、编码:字符编码,音频编码,压缩编码,加密编码 3.2、网络协议 3.3、数据文件格式:BMP,WAV 3.4、精确的bit操作 三、实例 既然是移位运算,那么int值肯定是要转成2进制数字才能看的直观明白。 Integer.toBinaryString(int num); //用来看到二进制的值。 以下就准备用15这个数字进行举例,不理解进制转换的请复习以下基础知识 16进制 2进制 10进制 0xF 1111 15 1、正整数简单左移右移 移位 2进制 10进制 15<<2 111100 60 15>>2 11 3 15...
相关文章
文章评论
共有0条评论来说两句吧...
文章二维码
点击排行
推荐阅读
最新文章
- CentOS关闭SELinux安全模块
- Windows10,CentOS7,CentOS8安装Nodejs环境
- MySQL8.0.19开启GTID主从同步CentOS8
- CentOS7,8上快速安装Gitea,搭建Git服务器
- CentOS8编译安装MySQL8.0.19
- Springboot2将连接池hikari替换为druid,体验最强大的数据库连接池
- MySQL数据库在高并发下的优化方案
- Docker使用Oracle官方镜像安装(12C,18C,19C)
- Dcoker安装(在线仓库),最新的服务器搭配容器使用
- SpringBoot2编写第一个Controller,响应你的http请求并返回结果