本人对于Python学习创建了一个小小的学习圈子,为各位提供了一个平台,大家一起来讨论学习Python。欢迎各位到来Python学习群:960410445一起讨论视频分享学习。Python是未来的发展方向,正在挑战我们的分析能力及对世界的认知方式,因此,我们与时俱进,迎接变化,并不断的成长,掌握Python核心技术,才是掌握真正的价值所在。
大致思路
1、发送请求
2、得到响应数据
3、储存数据
分享一些简单的爬虫入门知识点:
1、response的常见属性:
2、response.text响应体 str类型
3、respones.content响应体 bytes类型
4、response.status_code响应状态码
5、response.request.headers响应对应的请求头
6、response.headers响应头
7、response.request.cookies响应对应请求的cookie
8、response.cookies响应的cookie(经过了set-cookie动作)
获取网页源码的常用方法:
1、response.content.decode()
2、response.content.decode("GBK")
3、response.text
以上三种方法从前往后尝试,能够100%的解决所有网页解码的问题
代码
再来个爬去标题类的