手把手教你爬取天堂网1920*1080大图片（批量下载）——理论篇

O听_海_轩O 2020-09-14

展开全文

不经一番寒彻骨，怎得梅花扑鼻香。

/1 前言/

平时我们要下载图片，要要一个一个点击下载是不是觉得很麻烦？那有没有更加简便的方法呢？答案是肯定的，这里我们以天堂网为例，批量下载天堂网的图片。

/2 项目准备工作/

首先我们第一步我们要安装一个pycham的软件。可以参考这篇文章：Python环境搭建—安利Python小白的Python和Pycharm安装详细教程。

天堂网的网址：

https://www.ivsky.com/bizhi/1920x1080/

我们需要下载几个库，怎么下载呢？打开pycharm，依次点击File，再点开Settings，如下图所示。

打开后会出现这个界面点击你的项目名字（project：（你的项目名字）），之后在project interpreter下，点击加号，而后下载我们需要的库，如下图所示。

本项目需要用到的是库是requests、lxml、fake_useragent，如下图所示。fake_useragent一般是没有的，需要通过下面的命令进行安装：

pip install fake_useragent

/3 项目实现/

1. 导入需要的库（requests，lxml， fake_useragent）。

2. 我用了封装方法去实现各个部分的功能。首先要写一个框架：构造一个类TianTangWebsite ，然后定义一个__init__方法里继承（self），再定义一个主方法（main）。最后实现这个main方法，依次一步一步进行实现。

3. 我们把天堂网的网址拿过来，构造请求头。这里说一下这个UserAgent的获取方法。在打开天堂网的网站后，按下键盘上的F12键，之后会进入到开发者模式，之后点开network，如下图所示。

4. 而后随便点击一个name，复制header里边的UserAgent就可以了。

5. 我们点击下一页的地址观察网址的变化，如下所示：

https://www.ivsky.com/bizhi/1920x1080/index_2.htmlhttps://www.ivsky.com/bizhi/1920x1080/index_3.htmlhttps://www.ivsky.com/bizhi/1920x1080/index_4.html

很明显的发现，这个网址的网页数字一直在变化。我们可以用格式化{}去代替变化的值，类似这样：

https://www.ivsky.com/bizhi/1920x1080/index_{}.html

6. 然后我们用for循环去遍历这些网址，代码如下所示：

def main(self): for i in range(1,2):#页数随机客户随便设置 url=self.url.format(i) print(url)

7. 我们定义这个get_home()方法去请求到这个网址。

9. 我们需要解析得到的数据，接下来定义一个xiap的方法，拿到我们请求的网址。接下来就是该项目的关键了。

10. 至此，针对反爬虫的措施我们已经提前做好了准备，下一步将进行网页结构的分析以及网页图片地址数据的提取，并针对解析出来的图片地址予以批量下载，具体实现咱们下篇文章进行详解。

/4 小结/

本文主要内容为对图片网站进行了基本简介，基于 Python 中的爬虫库 requests 、lxml、fake_useragent，提前部署了请求头，模拟浏览器，针对反爬虫的措施我们已经提前做好了准备。

本站是提供个人知识管理的网络存储空间，所有内容均由用户发布，不代表本站观点。请注意甄别内容中的联系方式、诱导购买等信息，谨防诈骗。如发现有害或侵权内容，请点击一键举报。

转藏分享

QQ空间 QQ好友新浪微博微信

献花（0） +1

来自： O听_海_轩O > 《py实战训练》

举报/认领

0条评论

发表

请遵守用户评论公约

类似文章 更多

O听_海_轩O

关注对话

TA的最新馆藏

培训班——核心抄底机密
留意这样的高量阴，容易大涨
关注，这支25%
抄底方法系列图谱
放量大阴的短线擒拿术
这样的假阴真阳位置，成功率才高

喜欢该文的人也喜欢更多

热门阅读换一换