python爬虫新库：requests-html，一个库顶2个用

爬虫三步走：

发送请求获取网页HTML
解释网页HTML,得到数据或连接
下载或保存数据
现有的资料基本上都是每一步用一个库。

大白学习爬虫第一步时，用得最多的库还是requests，第二步时会用BeautifulSoup库。
现在requests作者出一个新的库：requests-html，它可以帮你用一个库，完成爬虫的第一步与第二步，使得写代码与运行也简便与快捷多了。

requests-html只支持Python 3.6及更新的版本，所以使用老版本的Python的同学需要更新一下Python版本了。

安装：

pip install requests-html

使用

requests-html库核心是学习其HTML类

第一步：获取网页HTML：

from requests_html import HTMLSession

session = HTMLSession()
r = session.get("http://www.jianshu.com")

#第一步：获取网页HTML：
print(r.html.html)

#打印出简书的HTML网页代码

第二步：解释网页HTML,得到数据或连接

links和 absolute_links两个属性分别返回HTML对象所包含的所有链接和绝对链接（均不包含锚点）。

from requests_html import HTMLSession

session = HTMLSession()
r = session.get("http://www.jianshu.com")

#第一步：获取网页HTML：
#print(r.html.html)

#打印出简书的HTML网页代码

#第二步：解释网页HTML,得到数据或连接
#返回的数据是一个set集合
print("links返回的数据类型:"+ str(type(r.html.links)))
for html in r.html.links:
    print(html)

print("-" * 30)

print("absolute_links返回的数据类型:"+     str(type(r.html.absolute_links)))
for html in r.html.links:
    print(html)

以下是打印结果：

links返回的数据类型:<class 'set'>
https://www.jianshu.com/p/5510d62f613d?utm_medium=index-banner&utm_source=desktop
/p/e3e0734f2d52
/p/c22ed25a7094#comments
/u/c0b66cf61400
https://www.jianshu.com/p/a37929ad1994?utm_medium=index-banner&utm_source=desktop
http://218.242.124.22:8081/businessCheck/verifKey.do?showType=extShow&serial=9031000020171107081457000002158769-SAIC_SHOW_310000-20171115131223587837&signData=MEQCIADWZ5aTcBeER5SOVp0ly+ElvKnwtjczum6Gi6wZ7/wWAiB9MAPM22hp947ZaBobux5PDkd0lfqoCOkVV7zjCYME6g==
/p/c22ed25a7094
/u/530f5d6d4108
/sign_up
/mobile/club

absolute_links返回的数据类型:<class 'set'>
https://www.jianshu.com/p/5510d62f613d?utm_medium=index-banner&utm_source=desktop
https://www.jianshu.com/p/5d6f22ebacd2#comments
https://www.jianshu.com/mobile/club

获取元素

request-html支持CSS选择器语法来选取HTML元素。
CSS选择器语法，它需要使用HTML的find函数，该函数有5个参数，作用如下：

selector，要用的CSS选择器；
clean，布尔值，如果为真会忽略HTML中style和script标签造成的影响（原文是sanitize，大概这么理解）;
containing，如果设置该属性，会返回包含该属性文本的标签；
first，布尔值，如果为真会返回第一个元素，否则会返回满足条件的元素列表；
_encoding，编码格式。

以下一行代码就可以获取元素，取其text属性就可以得到元素的内容，过程中少了加载BeautifulSoup库，写代码也更方便了。

from requests_html import HTMLSession

session = HTMLSession()
r = session.get("http://www.jianshu.com")

#获取首页span元素的内容：首页
print(r.html.find("span.menu-text",first=True).text)
#打印：首页

处理JavaScript

有些网站是使用JavaScript渲染的，这样的网站爬取到的结果只有一堆JS代码，这样的网站requests-html也可以处理，关键一步就是在HTML结果上调用一下render函数，它会在用户目录（默认是 ~/.pyppeteer/）中下载一个chromium，然后用它来执行JS代码。

from requests_html import HTMLSession
session = HTMLSession()
r = session.get('http://python-requests.org/')
r.html.render()
[W:pyppeteer.chromium_downloader] start chromium download.
Download  may take a few minutes.
[W:pyppeteer.chromium_downloader] chromium download done.
[W:pyppeteer.chromium_downloader] chromium extracted to: C:\Users\xxxx\.pyppeteer\local-chromium\571375
r.html.search('Python 2 will retire in only {months} months!')['months']
'<time>25</time>'

render函数还有一些参数，顺便介绍一下（这些参数有的还有默认值，直接看源代码方法参数列表即可）：

retries: 加载页面失败的次数

script: 页面上需要执行的JS脚本（可选）
wait: 加载页面钱的等待时间（秒），防止超时（可选）
scrolldown: 页面向下滚动的次数
sleep: 在页面初次渲染之后的等待时间
reload: 如果为假，那么页面不会从浏览器中加载，而是从内存中加载
keep_page: 如果为真，允许你用 r.html.page访问页面

PS: 这个库更似是将2个库合为一个库来使用，不管怎样，它给我们节省了时间，加快了代码运行速度，甚是好用。

大白python.png

人面猴
序言：七十年代末，一起剥皮案震惊了整个滨河市，随后出现的几起案子，更是在滨河造成了极大的恐慌，老刑警刘岩，带你破解...
沈念sama阅读 204,053评论 6赞 478
死咒
序言：滨河连续发生了三起死亡事件，死亡现场离奇诡异，居然都是意外死亡，警方通过查阅死者的电脑和手机，发现死者居然都...
沈念sama阅读 85,527评论 2赞 381
救了他两次的神仙让他今天三更去死
文/潘晓璐我一进店门，熙熙楼的掌柜王于贵愁眉苦脸地迎上来，“玉大人，你说我怎么就摊上这事。” “怎么了？”我有些...
开封第一讲书人阅读 150,779评论 0赞 337
道士缉凶录：失踪的卖姜人
文/不坏的土叔我叫张陵，是天一观的道长。经常有香客问我，道长，这世上最难降的妖魔是什么？我笑而不...
开封第一讲书人阅读 54,685评论 1赞 276
港岛之恋（遗憾婚礼）
正文为了忘掉前任，我火速办了婚礼，结果婚礼上，老公的妹妹穿的比我还像新娘。我一直安慰自己，他们只是感情好，可当我...
茶点故事阅读 63,699评论 5赞 366
恶毒庶女顶嫁案：这布局不是一般人想出来的
文/花漫我一把揭开白布。她就那样静静地躺着，像睡着了一般。火红的嫁衣衬着肌肤如雪。梳的纹丝不乱的头发上，一...
开封第一讲书人阅读 48,609评论 1赞 281
城市分裂传说
那天，我揣着相机与录音，去河边找鬼。笑死，一个胖子当着我的面吹牛，可吹牛的内容都是我干的。我是一名探鬼主播，决...
沈念sama阅读 37,989评论 3赞 396
双鸳鸯连环套：你想象不到人心有多黑
文/苍兰香墨我猛地睁开眼，长吁一口气：“原来是场噩梦啊……” “哼！你这毒妇竟也来了？” 一声冷哼从身侧响起，我...
开封第一讲书人阅读 36,654评论 0赞 258
万荣杀人案实录
序言：老挝万荣一对情侣失踪，失踪者是张志新（化名）和其女友刘颖，没想到半个月后，有当地人在树林里发现了一具尸体，经...
沈念sama阅读 40,890评论 1赞 298
护林员之死
正文独居荒郊野岭守林人离奇死亡，尸身上长有42处带血的脓包…… 初始之章·张勋以下内容为张勋视角年9月15日...
茶点故事阅读 35,634评论 2赞 321
白月光启示录
正文我和宋清朗相恋三年，在试婚纱的时候发现自己被绿了。大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
茶点故事阅读 37,716评论 1赞 330
活死人
序言：一个原本活蹦乱跳的男人离奇死亡，死状恐怖，灵堂内的尸体忽然破棺而出，到底是诈尸还是另有隐情，我是刑警宁泽，带...
沈念sama阅读 33,394评论 4赞 319
日本核电站爆炸内幕
正文年R本政府宣布，位于F岛的核电站，受9级特大地震影响，放射性物质发生泄漏。R本人自食恶果不足惜，却给世界环境...
茶点故事阅读 38,976评论 3赞 307
男人毒药：我在死后第九天来索命
文/蒙蒙一、第九天我趴在偏房一处隐蔽的房顶上张望。院中可真热闹，春花似锦、人声如沸。这庄子的主人今日做“春日...
开封第一讲书人阅读 29,950评论 0赞 19
一桩弑父案，背后竟有这般阴谋
文/苍兰香墨我抬头看了看天上的太阳。三九已至，却和暖如春，着一层夹袄步出监牢的瞬间，已是汗流浃背。一阵脚步声响...
开封第一讲书人阅读 31,191评论 1赞 260
情欲美人皮
我被黑心中介骗来泰国打工，没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留，地道东北人。一个月前我还...
沈念sama阅读 44,849评论 2赞 349
代替公主和亲
正文我出身青楼，却偏偏与公主长得像，于是被迫代替她去往敌国和亲。传闻我的和亲对象是个残疾皇子，可洞房花烛夜当晚...
茶点故事阅读 42,458评论 2赞 342

python爬虫新库：requests-html，一个库顶2个用

安装：

使用

第一步：获取网页HTML：

第二步：解释网页HTML,得到数据或连接

获取元素

处理JavaScript

推荐阅读更多精彩内容