内容简介:vscrawler是一个适合应对爬虫封堵的抓取框架。 当前发布0.2.2版本,在0.2.2版中,我重新设计了资源管理队列,用来处理爬虫所需要的基础资源(账号、设备号,token)的分发、轮询、评分、封禁解禁。该队列使用了我...
vscrawler是一个适合应对爬虫封堵的抓取框架。
当前发布0.2.2版本,在0.2.2版中,我重新设计了资源管理队列,用来处理爬虫所需要的基础资源(账号、设备号,token)的分发、轮询、评分、封禁解禁。该队列使用了我之前设计的用来管理代理ip队列的smartProxyQueue队列https://gitee.com/virjar/proxyipcenter/blob/master/doc/client/design/SmartProxyQueue.md。
评分队列能够自动的根据各个资源的质量(通过feedback评分)调整资源的使用优先级,实现高质量资源高优先级使用,低质量资源低频使用。同时评分队列在存储层做了封装,提供ram和 redis 两套存储方案,可以隔离分布式环境下资源在多机隔离问题。
目前账号资源管理模块已经切换到该模型上面,使用UserManager2替代了之前的UserManager,并且测试使用正常。
另外一个值得高兴的是,本次版本是vscrawler首次在我所在公司内部使用,公司内部需求主要是在线抓取,但是也需要资源管理,session复用,代理切换,链式抽取等功能。本次发布的版本也因为公司需求做了部分适配,当然也发现了一些之前设计的漏洞,并且一并修复。
你可以在这里看到vscrawler的完整文档http://vscrawler.virjar.com/ 或者在这里看到项目完整源码:https://gitee.com/virjar/vscrawler 如果想参与vscrawler的设计讨论,可以通过邮箱:virjar@virjar.com和我取得联系。
【声明】文章转载自:开源中国社区 [http://www.oschina.net]
以上所述就是小编给大家介绍的《vscrawler 0.2.2 发布,一个适合应对爬虫封堵的抓取框架》,希望对大家有所帮助,如果大家有任何疑问请给我留言,小编会及时回复大家的。在此也非常感谢大家对 码农网 的支持!
猜你喜欢:本站部分资源来源于网络,本站转载出于传递更多信息之目的,版权归原作者或者来源机构所有,如转载稿涉及版权问题,请联系我们。
The Filter Bubble
Eli Pariser / Penguin Press / 2011-5-12 / GBP 16.45
In December 2009, Google began customizing its search results for each user. Instead of giving you the most broadly popular result, Google now tries to predict what you are most likely to click on. Ac......一起来看看 《The Filter Bubble》 这本书的介绍吧!