分布式爬虫爬取知乎用户—页面分析篇

使用python3爬取知乎用户信息并分析

参考了：呓语 » 如何写一个简单的分布式知乎爬虫？打算自己做一个python3的分布式爬虫

想要抓取数据，首先分析用户信息页面的构成，以轮子哥为例

红框里的便我们要抓取的用户关键信息（的一部分）。

最上面是我们的目标URL：https://www.zhihu.com/people/excited-vczh/answers。

观察一下这个URL的组成：

http://www.zhihu.com + /people + /excited-vczh + /answer

可以发现只有 excited-vczh 这部分是会变化的，它代表着知乎用户的唯一ID，在知乎的数据格式中，它的键名叫做 urlToken。

所以我们可以用拼接字符串的形式，得到我们待抓取页面的URL：

url='%s/people/%s/answers'%(host,urlToken)

页面URL有了，而且从上图我们可以发现 不登录 也可以访问用户主页，这说明我们可以不用考虑模拟登陆的问题，可以自由的获取用户主页面源码。

那么我们如何从用户主页的源码中获取用户的数据呢？一开始我以为需要挨个匹配页面中对应的部分，但我查看源码的时候发现知乎把用户数据集集中放到了源码的一个地方，那就是 id="data" 的 div 的 data-state 属性的值中，看下图：

从上图我们可以发现，date-state 的属性值中藏有用户的信息，比如我们可以依次找到用户的教育经历（educations）、简介（headline）、参与的 Live 数量（participatedLiveCount）、关注的收藏夹数量（followingFavlistsCount）、被收藏的次数（favoritedCount）、关注他的用户数（followerCount）、关注的话题数量（followingTopicCount）、用户描述（description）等信息。通过观察我们也可以发现，数据应该是以 JSON 格式存储。

知道了用户数据都藏在 date-state 中，我们用 lxml

把该属性的值取出来，然后作为 JSON 格式读取，再把数据集中存储用户数据的部分提取出来即可，看代码：

html = etree.HTML(request.text)

result = html.xpath("//div[@id='data']/@data-state")

result = json.loads(result[0])

print(result['entities']['users'][urlToken])

选择抓取用户的关注者(follower)列表，我们可以根据知乎的api来抓取用户的关注者列表

关注者列表api: https://www.zhihu.com/api/v4/members/excited-vczh/followers?include=data%5B*%5D.answer_count%2Carticles_count%2Cgender%2Cfollower_count%2Cis_followed%2Cis_following%2Cbadge%5B%3F(type%3Dbest_answerer)%5D.topics&offset='+str(offset)+'&limit=20'

关注列表api: https://www.zhihu.com/api/v4/members/excited-vczh/followees?include=data%5B*%5D.answer_count%2Carticles_count%2Cgender%2Cfollower_count%2Cis_followed%2Cis_following%2Cbadge%5B%3F(type%3Dbest_answerer)%5D.topics&offset='+str(offset)+'&limit=20'

每页默认显示20个用户

代码如下：

def getFollowers(self,offset):

getFolloweesUrl ='https://www.zhihu.com/api/v4/members/excited-vczh/followers?include=data%5B*%5D.answer_count%2Carticles_count%2Cgender%2Cfollower_count%2Cis_followed%2Cis_following%2Cbadge%5B%3F(type%3Dbest_answerer)%5D.topics&offset='+str(offset)+'&limit=20'

req =self.session.get(url=getFolloweesUrl,headers=headers)

hjson = json.loads(req.text)

flag = hjson['paging']['is_end'] #is_end为true结束

for i in range(0,20):

print(hjson['data'][i]['url_token']) #打印用户url_token

offsetFlag= offsetFlag+20 #下一页

注意：使用api获取关注者或关注列表必须登陆，不登陆会报错误代码

关于登录请查看我的GitHub

最后编辑于：2018.03.09 22:06:49

人面猴
序言：七十年代末，一起剥皮案震惊了整个滨河市，随后出现的几起案子，更是在滨河造成了极大的恐慌，老刑警刘岩，带你破解...
沈念sama阅读 203,362评论 5赞 477
死咒
序言：滨河连续发生了三起死亡事件，死亡现场离奇诡异，居然都是意外死亡，警方通过查阅死者的电脑和手机，发现死者居然都...
沈念sama阅读 85,330评论 2赞 381
救了他两次的神仙让他今天三更去死
文/潘晓璐我一进店门，熙熙楼的掌柜王于贵愁眉苦脸地迎上来，“玉大人，你说我怎么就摊上这事。” “怎么了？”我有些...
开封第一讲书人阅读 150,247评论 0赞 337
道士缉凶录：失踪的卖姜人
文/不坏的土叔我叫张陵，是天一观的道长。经常有香客问我，道长，这世上最难降的妖魔是什么？我笑而不...
开封第一讲书人阅读 54,560评论 1赞 273
港岛之恋（遗憾婚礼）
正文为了忘掉前任，我火速办了婚礼，结果婚礼上，老公的妹妹穿的比我还像新娘。我一直安慰自己，他们只是感情好，可当我...
茶点故事阅读 63,580评论 5赞 365
恶毒庶女顶嫁案：这布局不是一般人想出来的
文/花漫我一把揭开白布。她就那样静静地躺着，像睡着了一般。火红的嫁衣衬着肌肤如雪。梳的纹丝不乱的头发上，一...
开封第一讲书人阅读 48,569评论 1赞 281
城市分裂传说
那天，我揣着相机与录音，去河边找鬼。笑死，一个胖子当着我的面吹牛，可吹牛的内容都是我干的。我是一名探鬼主播，决...
沈念sama阅读 37,929评论 3赞 395
双鸳鸯连环套：你想象不到人心有多黑
文/苍兰香墨我猛地睁开眼，长吁一口气：“原来是场噩梦啊……” “哼！你这毒妇竟也来了？” 一声冷哼从身侧响起，我...
开封第一讲书人阅读 36,587评论 0赞 258
万荣杀人案实录
序言：老挝万荣一对情侣失踪，失踪者是张志新（化名）和其女友刘颖，没想到半个月后，有当地人在树林里发现了一具尸体，经...
沈念sama阅读 40,840评论 1赞 297
护林员之死
正文独居荒郊野岭守林人离奇死亡，尸身上长有42处带血的脓包…… 初始之章·张勋以下内容为张勋视角年9月15日...
茶点故事阅读 35,596评论 2赞 321
白月光启示录
正文我和宋清朗相恋三年，在试婚纱的时候发现自己被绿了。大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
茶点故事阅读 37,678评论 1赞 329
活死人
序言：一个原本活蹦乱跳的男人离奇死亡，死状恐怖，灵堂内的尸体忽然破棺而出，到底是诈尸还是另有隐情，我是刑警宁泽，带...
沈念sama阅读 33,366评论 4赞 318
日本核电站爆炸内幕
正文年R本政府宣布，位于F岛的核电站，受9级特大地震影响，放射性物质发生泄漏。R本人自食恶果不足惜，却给世界环境...
茶点故事阅读 38,945评论 3赞 307
男人毒药：我在死后第九天来索命
文/蒙蒙一、第九天我趴在偏房一处隐蔽的房顶上张望。院中可真热闹，春花似锦、人声如沸。这庄子的主人今日做“春日...
开封第一讲书人阅读 29,929评论 0赞 19
一桩弑父案，背后竟有这般阴谋
文/苍兰香墨我抬头看了看天上的太阳。三九已至，却和暖如春，着一层夹袄步出监牢的瞬间，已是汗流浃背。一阵脚步声响...
开封第一讲书人阅读 31,165评论 1赞 259
情欲美人皮
我被黑心中介骗来泰国打工，没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留，地道东北人。一个月前我还...
沈念sama阅读 43,271评论 2赞 349
代替公主和亲
正文我出身青楼，却偏偏与公主长得像，于是被迫代替她去往敌国和亲。传闻我的和亲对象是个残疾皇子，可洞房花烛夜当晚...
茶点故事阅读 42,403评论 2赞 342

分布式爬虫爬取知乎用户—页面分析篇

使用python3爬取知乎用户信息并分析

推荐阅读更多精彩内容