scrapy 使用自定义的过滤器

内容简介：这边我写了一个自定义的过滤器，继承于scrapy-redis中的。因为我有个需求是，这条url https://segmentfault.com/stop-robot不过滤。settings.py注意我项目名字是tutorial

from scrapy_redis.dupefilter import RFPDupeFilter



class CustomFilter(RFPDupeFilter):
    def request_seen(self, request):
        """Returns True if request was already seen.

        Parameters
        ----------
        request : scrapy.http.Request

        Returns
        -------
        bool

        """
        if 'https://segmentfault.com/stop-robot' in request.url:
            return False
        fp = self.request_fingerprint(request)
        # This returns the number of values added, zero if already exists.
        added = self.server.sadd(self.key, fp)
        return added == 0

这边我写了一个自定义的过滤器，继承于scrapy-redis中的。因为我有个需求是，这条url https://segmentfault.com/stop-robot不过滤。

settings.py

DUPEFILTER_CLASS = 'tutorial.CustomFilter.CustomFilter'

注意我项目名字是tutorial

4615

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持码农网

查看所有标签

猜你喜欢:

本站部分资源来源于网络，本站转载出于传递更多信息之目的，版权归原作者或者来源机构所有，如转载稿涉及版权问题，请联系我们。

码农书籍

传统企业，互联网在踢门

刘润 / 中国华侨出版社 / 2014-7 / 42

1、第一本传统企业互联网化的战略指导书,首次提出“互联网加减法”，迄今最清晰的转型公式鉴于目前很多传统企业“老办法不管用，新办法不会用”的现状，本书将用“互联网的加减法” 这个简单模型清晰地说明商业新时代的游戏规则和全新玩法，帮助传统企业化解“本领恐慌” 。 2、小米董事长&CEO 金山软件董事长雷军，新东方教育科技集团董事长兼CEO俞敏洪，复旦大学管理学院院长陆雄文，复旦大学博士、......一起来看看《传统企业，互联网在踢门》这本书的介绍吧!

码农工具

scrapy 使用自定义的过滤器

传统企业，互联网在踢门

RGB转16进制工具

MD5 加密

RGB CMYK 转换工具