分享

ROBOTSTXT_OBEY = False 粗解

 一本正经地胡闹 2019-06-22
  • 爬虫协议,即 robots 协议,也叫机器人协议
    它用来限定爬虫程序可以爬取的内容范围
    通常写在 robots.txt 文件中

  • 该文件保存在网站的服务器上
    爬虫程序访问网站时首先查看此文件

  • 在 scrapy 项目的 settings.py 文件中
    默认 ROBOTSTXT_OBEY = True ,即遵守此协议
    当爬取内容不符合该协议且仍要爬取时
    设置 ROBOTSTXT_OBEY = False ,不遵守此协议


转自:https://www.jianshu.com/p/19c1ea0d59c2

    本站是提供个人知识管理的网络存储空间,所有内容均由用户发布,不代表本站观点。请注意甄别内容中的联系方式、诱导购买等信息,谨防诈骗。如发现有害或侵权内容,请点击一键举报。
    转藏 分享 献花(0

    0条评论

    发表

    请遵守用户 评论公约

    类似文章 更多