Java爬虫之下载IMDB中Top250电影的图片
介绍
在博客:Scrapy爬虫(4)爬取豆瓣电影Top250图片中我们利用Python的爬虫框架Scrapy,将豆瓣电影Top250图片下载到自己电脑上。那么,在Java的爬虫的也可以下载图片吗?答案当然是肯定的!
在本次分享中,我们将利用Java的Jsoup包和FileUtils.copyURLToFile()函数来实现图片的下载。我们将会爬取IMDB中Top250电影的图片到自己电脑上,其网页截图如下:
思路
我们实现图片下载的爬虫思路如下:
- 利用Jsoup解析网页,得到电影图片的url和name
- 利用FileUtils.copyURLToFile()函数将图片下载到本地
准备
在本文程序中,除了Jsoup包外,还用到了commons-io包,其下载地址为:https://mvnrepository.com/artifact/org.apache.commons/commons-io ,我们主要利用该package中的FileUtils.copyURLToFile(). 读者需要下载这两个包,并将它们在Eclipse中加入到项目的路径中。
程序
本次分享的主要程序为ImageScraper.java,其完整代码如下:
package wikiScrape; /* 本爬虫爬取http://www.imdb.cn/IMDB250/中Top250的图片 * 先利用Jsoup解析得到该网页中的图片的url * 然后利用FileUtils.copyURLToFile()函数将图片下载到本地 */ import java.io.*; import java.net.*; import java.util.Date; import java.util.ArrayList; import org.jsoup.Jsoup; import org.jsoup.nodes.Document; import org.jsoup.select.Elements; import org.apache.commons.io.FileUtils; public class ImageScraper { public static void main(String[] args) { Date d1 = new Date(); System.out.println("爬虫开始......"); // 爬取的网址列表,一共十个网页 ArrayList<String> urls = new ArrayList<String>(); urls.add("http://www.imdb.cn/IMDB250/"); for(int i=2; i<=10; i++) { urls.add("http://www.imdb.cn/imdb250/"+ Integer.toString(i)); } String dir = "E://log/"; // 图片储存目录 // 利用循环下载每个页面中的图片 for(String url: urls) { int index = urls.indexOf(url)+1; System.out.println("开始下载第"+index+"个网页中的图片..."); getPictures(url, dir); System.out.println("第"+index+"个网页中的图片下载完毕!\n"); } System.out.println("程序运行完毕!"); Date d2 = new Date(); // 计算程序的运行时间,并输出 long seconds = (d2.getTime()-d1.getTime())/1000; System.out.println("一共用时: "+seconds+"秒."); } // getContent()函数: 将网页中的电影图片下载到本地 public static void getPictures(String url, String dir){ // 利用URL解析网址 URL urlObj = null; try{ urlObj = new URL(url); } catch(MalformedURLException e){ System.out.println("The url was malformed!"); } // URL连接 URLConnection urlCon = null; try{ // 打开URL连接 urlCon = urlObj.openConnection(); // 将HTML内容解析成UTF-8格式 Document doc = Jsoup.parse(urlCon.getInputStream(), "utf-8", url); // 提取电影图片所在的HTML代码块 Elements elems = doc.getElementsByClass("ss-3 clear"); Elements pic_block = elems.first().getElementsByTag("a"); for(int i=0; i<pic_block.size(); i++) { // 提取电影图片的url, name String picture_url = pic_block.get(i).getElementsByTag("img").attr("src"); String picture_name = pic_block.get(i).getElementsByClass("bb").text()+".jpg"; // 用download()函数将电影图片下载到本地 download(picture_url, dir, picture_name); System.out.println("第"+(i+1)+"张图片下载完毕!"); } } catch(IOException e){ System.out.println("There was an error connecting to the URL"); } } // download()函数利用图片的url将图片下载到本地 public static void download(String url, String dir, String filename) { try { /* httpurl: 图片的url * dirfile: 图片的储存目录 */ URL httpurl = new URL(url); File dirfile = new File(dir); // 如果图片储存的目录不存在,则新建该目录 if (!dirfile.exists()) { dirfile.mkdirs(); } // 利用FileUtils.copyURLToFile()实现图片下载 FileUtils.copyURLToFile(httpurl, new File(dir+filename)); } catch(Exception e) { e.printStackTrace(); } } }
运行
运行以上程序,结果如下:
查看E盘中的log文件夹,内容如下:
一共下载了244张图片,用时140秒,有几张图片下载失败,效果还算OK.
本次分享就到此结束喽,欢迎大家交流~~

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。
持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。
转载内容版权归作者及来源网站所有,本站原创内容转载请注明来源。
- 上一篇
初学Python——第一节课
一、Python语言的特性: 1.与C语言不同,Python语言是一门解释性语言。程序在执行过程中,执行一步、编译一步。 2.Python是一个动态类型语言,不需要定义变量的数据类型。 3.Python是一门强类型语言。(如果定义了一个变量,如果不人为的强制类型转换,它永远都是开始的那种数据类型) 二、Python的优缺点: 优点:1.简单易懂,初学者很容易入门 2.开发效率高,具有强大的标准库和第三方库,大大降低开发周期,避免重复造轮子 3.高级语言,不用考虑内存一类的底层细节 4.有很强的可移植性、可扩展性和可嵌入性 当然,没有一门语言是完美的,它也有缺点: 1.运行速度慢,大多数情况下用户是感知不到的。相比C和JVAV来说,它确实慢一些,如果对速度要求很高,可以用其他语言去实现。 2.代码不能加密,源码是以明文形式存放的,当然这不一定是个缺点。如果需要源代码是加密的,可以不用这门语言来写。 3.线程不能利用多CPU的问题,Python的线程是操作系统的原生线程。 接下来是一些初步的学习,零散的知识: 1.Python的默认编码为UTF-8,而非ASCII(至少在Python3里)...
- 下一篇
Java 移位运算详解(2进制+原码+反码+补码)
一、参考 1、java高级之java的左移运算符和右移运算符 二、简述 1、定义: 符号 名称 实际操作 简单记忆 << 左移 2 进制左边补齐0位 乘以2的N次方 >> 右移 2 进制右边减少位数 除以2的N次方(其实并非如此,要舍去小数点) >>> 右移 2 进制右边0填充高位 除以2的N次方(其实并非如此,要舍去小数点) 2、速度:机器码是二进制01运算的,移位速度最快了 3、适用场景: 3.1、编码:字符编码,音频编码,压缩编码,加密编码 3.2、网络协议 3.3、数据文件格式:BMP,WAV 3.4、精确的bit操作 三、实例 既然是移位运算,那么int值肯定是要转成2进制数字才能看的直观明白。 Integer.toBinaryString(int num); //用来看到二进制的值。 以下就准备用15这个数字进行举例,不理解进制转换的请复习以下基础知识 16进制 2进制 10进制 0xF 1111 15 1、正整数简单左移右移 移位 2进制 10进制 15<<2 111100 60 15>>2 11 3 15...
相关文章
文章评论
共有0条评论来说两句吧...
文章二维码
点击排行
推荐阅读
最新文章
- SpringBoot2整合Thymeleaf,官方推荐html解决方案
- CentOS7设置SWAP分区,小内存服务器的救世主
- CentOS8编译安装MySQL8.0.19
- SpringBoot2配置默认Tomcat设置,开启更多高级功能
- Docker使用Oracle官方镜像安装(12C,18C,19C)
- Docker安装Oracle12C,快速搭建Oracle学习环境
- Linux系统CentOS6、CentOS7手动修改IP地址
- CentOS6,7,8上安装Nginx,支持https2.0的开启
- SpringBoot2初体验,简单认识spring boot2并且搭建基础工程
- Hadoop3单机部署,实现最简伪集群