介绍
在博客:Scrapy爬虫(4)爬取豆瓣电影Top250图片中我们利用Python的爬虫框架Scrapy,将豆瓣电影Top250图片下载到自己电脑上。那么,在Java的爬虫的也可以下载图片吗?答案当然是肯定的!
在本次分享中,我们将利用Java的Jsoup包和FileUtils.copyURLToFile()函数来实现图片的下载。我们将会爬取IMDB中Top250电影的图片到自己电脑上,其网页截图如下:
思路
我们实现图片下载的爬虫思路如下:
- 利用Jsoup解析网页,得到电影图片的url和name
- 利用FileUtils.copyURLToFile()函数将图片下载到本地
准备
在本文程序中,除了Jsoup包外,还用到了commons-io包,其下载地址为:https://mvnrepository.com/artifact/org.apache.commons/commons-io ,我们主要利用该package中的FileUtils.copyURLToFile(). 读者需要下载这两个包,并将它们在Eclipse中加入到项目的路径中。
程序
本次分享的主要程序为ImageScraper.java,其完整代码如下:
package wikiScrape;
import java.io.*;
import java.net.*;
import java.util.Date;
import java.util.ArrayList;
import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.select.Elements;
import org.apache.commons.io.FileUtils;
public class ImageScraper {
public static void main(String[] args) {
Date d1 = new Date();
System.out.println("爬虫开始......");
ArrayList<String> urls = new ArrayList<String>();
urls.add("http://www.imdb.cn/IMDB250/");
for(int i=2; i<=10; i++) {
urls.add("http://www.imdb.cn/imdb250/"+ Integer.toString(i));
}
String dir = "E://log/";
for(String url: urls) {
int index = urls.indexOf(url)+1;
System.out.println("开始下载第"+index+"个网页中的图片...");
getPictures(url, dir);
System.out.println("第"+index+"个网页中的图片下载完毕!\n");
}
System.out.println("程序运行完毕!");
Date d2 = new Date();
long seconds = (d2.getTime()-d1.getTime())/1000;
System.out.println("一共用时: "+seconds+"秒.");
}
public static void getPictures(String url, String dir){
URL urlObj = null;
try{
urlObj = new URL(url);
}
catch(MalformedURLException e){
System.out.println("The url was malformed!");
}
URLConnection urlCon = null;
try{
urlCon = urlObj.openConnection();
Document doc = Jsoup.parse(urlCon.getInputStream(), "utf-8", url);
Elements elems = doc.getElementsByClass("ss-3 clear");
Elements pic_block = elems.first().getElementsByTag("a");
for(int i=0; i<pic_block.size(); i++) {
String picture_url = pic_block.get(i).getElementsByTag("img").attr("src");
String picture_name = pic_block.get(i).getElementsByClass("bb").text()+".jpg";
download(picture_url, dir, picture_name);
System.out.println("第"+(i+1)+"张图片下载完毕!");
}
}
catch(IOException e){
System.out.println("There was an error connecting to the URL");
}
}
public static void download(String url, String dir, String filename) {
try {
URL httpurl = new URL(url);
File dirfile = new File(dir);
if (!dirfile.exists()) {
dirfile.mkdirs();
}
FileUtils.copyURLToFile(httpurl, new File(dir+filename));
}
catch(Exception e) {
e.printStackTrace();
}
}
}
运行
运行以上程序,结果如下:
查看E盘中的log文件夹,内容如下:
一共下载了244张图片,用时140秒,有几张图片下载失败,效果还算OK.
本次分享就到此结束喽,欢迎大家交流~~