python[requests]爬取知乎个人信息数据

栏目: Python · 发布时间: 6年前

内容简介：预览地址：

效果

预览地址： http://23.105.208.123/

python[requests]爬取知乎个人信息数据

技术栈

源码地址

https://github.com/MasakiOvO/...

python需要安装的库

requests,BeautifulSoup,redis,django

思路

两个程序。

一个程序负责爬取用户关注和粉丝列表，并把用户名存入set
另一个程序负责根据用户名获取详细信息，存入hash

维护两个列表 1.已爬用户 2.未爬用户

第一个程序的流程：

当未爬set不为空时：执行如下操作：
每次从未爬取列表中取出一个用户名 
根据用户名，获取他的关注与粉丝并遍历，如果用户既没在已爬用户，也没在未爬用户 加入未爬用户列表。

第二个程序的流程

每次从未爬set中取出一个用户名，调用接口获取详细信息并存入redis hash中

接口获取

python[requests]爬取知乎个人信息数据

打开某个人的个人主页，按F12

python[requests]爬取知乎个人信息数据

选择XHR 然后点击图1的关注我的人，和我关注的人，在图2就可以看到header和cookie。

获取用户列表Api:

https://www.zhihu.com/api/v4/... {username}/{type}?include=data[*].answer_count,articles_count,gender,follower_count,is_followed,is_following,badge[?(type=best_answerer)].topics&offset=20&limit=20

username 是用户名，

type 是类型，有两种可选 [followers,followees]， followers是粉丝 followees是关注

改变offset的值可以获取分页

获取个人信息Api:

https://www.zhihu.com/people/...

user_token是用户名

这个api中返回的是html页面，在html页面中有一个scirpt标签里面的内容是json格式的用户信息，这就很方便了，直接获取键值对对应的属性就ok。

发送请求

F12查看接口，把header和cookie放进requests.get()方法中。

剩下的就很简单了，不赘述了。

总结

还有很多优化的地方。比如加入中间件，来提升爬虫的稳定性。对数据进行分类，统计城市分布。

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持码农网

查看所有标签

猜你喜欢:

本站部分资源来源于网络，本站转载出于传递更多信息之目的，版权归原作者或者来源机构所有，如转载稿涉及版权问题，请联系我们。

码农书籍

从问题到程序

裘宗燕 / 机械工业出版社 / 2011-5 / 39.00元

《从问题到程序:程序设计与C语言引论(第2版)》以C作为工具语言，讨论了基本程序设计的各方面内容，详细解释了与c语言和程序设计有关的问题。在新版中，特别加强了针对近年日益受到业界和学术界广泛重视的问题的讨论，并通过详细地分析和讨论大量符合C99标准的实例，给出了分析和分解问题、找出解决问题的主要步骤、确定函数抽象、找出循环、选择语言结构直至最后做出所需程序的完整过程。《从问题到程序:程序设......一起来看看《从问题到程序》这本书的介绍吧!

码农工具