搜索

分享

QQ空间 QQ好友新浪微博微信

ROBOTSTXT_OBEY = False 粗解

一本正经地胡闹 2019-06-22

展开全文

爬虫协议，即 robots 协议，也叫机器人协议
它用来限定爬虫程序可以爬取的内容范围
通常写在 robots.txt 文件中
该文件保存在网站的服务器上
爬虫程序访问网站时首先查看此文件
在 scrapy 项目的 settings.py 文件中
默认 ROBOTSTXT_OBEY = True ，即遵守此协议
当爬取内容不符合该协议且仍要爬取时
设置 ROBOTSTXT_OBEY = False ，不遵守此协议

转自：https://www.jianshu.com/p/19c1ea0d59c2

本站是提供个人知识管理的网络存储空间，所有内容均由用户发布，不代表本站观点。请注意甄别内容中的联系方式、诱导购买等信息，谨防诈骗。如发现有害或侵权内容，请点击一键举报。

转藏分享

QQ空间 QQ好友新浪微博微信

献花（0） +1

来自：一本正经地胡闹 > 《计算机》

举报/认领

0条评论

请遵守用户评论公约

类似文章 更多

一本正经地胡闹

关注对话

TA的最新馆藏

深圳南山区非富即贵楼盘天龙人
酸枣仁补肝养血
从中年失业男到月入几万，保险2周年感悟
g与π²极为接近，巧合还是必然？
面粉
中风诊治第四章中风病恢复期（2）在线免费阅读

喜欢该文的人也喜欢更多

热门阅读换一换