Python采集B站最新周杰伦MV内容, 粉丝评论并实现词云分析

前言

大家早好、午好、晚好吖~
[图片上传失败...(image-98132a-1657699277011)]

环境使用:

Python 3.8
Pycharm 2021.2版本
ffmpeg <需要设置环境变量>

模块使用:

import requests >>> pip install requests

内置模块你安装好python环境就可以了

import re
import json
import subprocess

如果安装python第三方模块:

win + R 输入 cmd 点击确定, 输入安装命令 pip install 模块名 (pip install requests) 回车
在pycharm中点击Terminal(终端) 输入安装命令

基本思路流程:

采集视频数据.... 1. 视频标题 2. 视频内容

1、对着网页鼠标右键点击查看网页源代码 ctrl + F 搜索 playinfo

代码实现步骤: <通用>

发送请求, 模拟浏览器对于url地址发送请求
获取数据, 获取网页源代码 <因为我们想要数据内容, 来自于网页源代码>
解析数据, 提取我们想要数据内容
保存数据, 把视频内容完整的保存到本地文件夹

代码

采集视频

# 导入数据请求模块
import requests
# 导入正则
import re
# 导入json
import json
# 导入格式化输出模块
import pprint
# 导入进程模块
import subprocess

"""

发送请求

模拟浏览器对于url地址发送请求
"""

# 确定网址
url = 'https://www.bilibili.com/video/BV1ua411p7iA?vd_source=b2da3931eefc454d41eb6bb5b34749d1'
# python代码如何模拟浏览器? 请求头 ---> 用伪装python代码
headers = {
    # referer 防盗链 告诉服务器请求url地址是从哪里跳过过来
    'referer': 'https://www.bilibili.com/',
    # user-agent 用户代理 表示浏览器基本身份标识
    'user-agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/101.0.0.0 Safari/537.36'
}
# 发送请求  ---> 得到响应对象 200 状态码表示请求成功
response = requests.get(url=url, headers=headers)
# <Response [200]>
print(response)

获取数据

# 获取数据 得到响应对象文本数据 ---> 字符串数据类型
# print(response.text)

"""

解析数据

提取我们想要数据内容
正则表达式 re ---> 对于字符串数据进行提取
---> 0 1 2 开始计数 -3 -2 -1<---
lis = ['a', 'b', 'c'] lis[0] lis[-3]

re.findall() --> 匹配数据返回列表数据类型列表取值: 根据索引位置提取内容
re 模块名
.findall() 调用re模块里面findall()方法 --> 找到所有 <我们想要数据>
从什么地方去找什么数据
从 response.text 里面去找 "title":"(.?)","pubdate" 其中 (.?) 这段是我们想要的
"""

源码、解答、教程可加Q裙：832157862
# 获取标题
title = re.findall('"title":"(.*?)","pubdate"', response.text)[0].replace(' ', '')
# 正则替换特殊字符
title = re.sub(r'[\/:*?"<>|]', '', title)
# 获取shipin数据信息
html_data = re.findall('<script>window.__playinfo__=(.*?)</script>', response.text)[0]
# 转成json字典数据类型
json_data = json.loads(html_data)
# 字典取值 --> 键值对取值, 根据冒号左边内容[键]  提取冒号右边的内容[值]
audio_url = json_data['data']['dash']['audio'][0]['baseUrl']
video_url = json_data['data']['dash']['video'][0]['baseUrl']
print(audio_url)
print(video_url)
print(title)

保存数据

--> 403 Forbidden 没有访问权限 --> 防盗链加headers请求头

# 发送请求 获取音频二进制数据
audio_content = requests.get(url=audio_url, headers=headers).content
# 发送请求 获取视频二进制数据
# video__content = requests.get(url=video_url, headers=headers).content
# with open('video\\' + title + '.mp3', mode='wb') as a:
#     a.write(audio_content)
# with open('video\\' + title + '.mp4', mode='wb') as v:  # 丨
#     v.write(video__content)

# 通过ffmpeg 这个软件命令 进行视频合成
cmd = f"ffmpeg -i video\\{title}.mp4 -i video\\{title}.mp3 -c:v copy -c:a aac -strict experimental video\\{title}output.mp4"
subprocess.run(cmd, shell=True)

采集评论

源码、解答、教程可加Q裙：832157862
# 导入数据请求模块
import time

import requests

for page in range(1, 11):
    # 请求网址
    time.sleep(1)
    url = f'https://api.bilibili.com/x/v2/reply/main?csrf=9b972b9803693b4f5c0d6a042b2d0c0e&mode=3&next={page}&oid=215631694&plat=1&type=1'
    # 请求头
    headers = {
        # 'origin': 'https://www.bilibili.com',
        'referer': 'https://www.bilibili.com/video/',
        'user-agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/101.0.0.0 Safari/537.36',
    }
    # 发送请求
    response = requests.get(url=url, headers=headers)
    # 获取数据
    content_list = [i['content']['message'] for i in response.json()['data']['replies']]
    print(content_list)
    # for 遍历输出内容
    for content in content_list:
        with open('评论.txt', mode='a', encoding='utf-8') as f:
            f.write(content)
            f.write('\n')
        print(content)

制作词云

# 导入结巴分词模块
import jieba
# 导入词云模块
import wordcloud
# 读取文件内容
f = open('评论.txt', encoding='utf-8')
txt = f.read()
print(txt)
string = ' '.join(jieba.lcut(txt))
print(string)
wc = wordcloud.WordCloud(
    width=700,   # 宽
    height=700,  # 高
    background_color='white',  # 背景颜色
    font_path='msyh.ttc',  # 设置字体
    scale=15,  # 规模
)
wc.generate(string)
wc.to_file('评论词云.png')

尾语

好了，我的这篇文章写到这里就结束啦！

有更多建议或问题可以评论区或私信我哦！一起加油努力叭(ง •_•)ง

喜欢就关注一下博主，或点赞收藏评论一下我的文章叭！！！

[图片上传失败...(image-c27b8f-1657699277011)]

人面猴
序言：七十年代末，一起剥皮案震惊了整个滨河市，随后出现的几起案子，更是在滨河造成了极大的恐慌，老刑警刘岩，带你破解...
沈念sama阅读 202,723评论 5赞 476
死咒
序言：滨河连续发生了三起死亡事件，死亡现场离奇诡异，居然都是意外死亡，警方通过查阅死者的电脑和手机，发现死者居然都...
沈念sama阅读 85,080评论 2赞 379
救了他两次的神仙让他今天三更去死
文/潘晓璐我一进店门，熙熙楼的掌柜王于贵愁眉苦脸地迎上来，“玉大人，你说我怎么就摊上这事。” “怎么了？”我有些...
开封第一讲书人阅读 149,604评论 0赞 335
道士缉凶录：失踪的卖姜人
文/不坏的土叔我叫张陵，是天一观的道长。经常有香客问我，道长，这世上最难降的妖魔是什么？我笑而不...
开封第一讲书人阅读 54,440评论 1赞 273
港岛之恋（遗憾婚礼）
正文为了忘掉前任，我火速办了婚礼，结果婚礼上，老公的妹妹穿的比我还像新娘。我一直安慰自己，他们只是感情好，可当我...
茶点故事阅读 63,431评论 5赞 364
恶毒庶女顶嫁案：这布局不是一般人想出来的
文/花漫我一把揭开白布。她就那样静静地躺着，像睡着了一般。火红的嫁衣衬着肌肤如雪。梳的纹丝不乱的头发上，一...
开封第一讲书人阅读 48,499评论 1赞 281
城市分裂传说
那天，我揣着相机与录音，去河边找鬼。笑死，一个胖子当着我的面吹牛，可吹牛的内容都是我干的。我是一名探鬼主播，决...
沈念sama阅读 37,893评论 3赞 395
双鸳鸯连环套：你想象不到人心有多黑
文/苍兰香墨我猛地睁开眼，长吁一口气：“原来是场噩梦啊……” “哼！你这毒妇竟也来了？” 一声冷哼从身侧响起，我...
开封第一讲书人阅读 36,541评论 0赞 256
万荣杀人案实录
序言：老挝万荣一对情侣失踪，失踪者是张志新（化名）和其女友刘颖，没想到半个月后，有当地人在树林里发现了一具尸体，经...
沈念sama阅读 40,751评论 1赞 296
护林员之死
正文独居荒郊野岭守林人离奇死亡，尸身上长有42处带血的脓包…… 初始之章·张勋以下内容为张勋视角年9月15日...
茶点故事阅读 35,547评论 2赞 319
白月光启示录
正文我和宋清朗相恋三年，在试婚纱的时候发现自己被绿了。大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
茶点故事阅读 37,619评论 1赞 329
活死人
序言：一个原本活蹦乱跳的男人离奇死亡，死状恐怖，灵堂内的尸体忽然破棺而出，到底是诈尸还是另有隐情，我是刑警宁泽，带...
沈念sama阅读 33,320评论 4赞 318
日本核电站爆炸内幕
正文年R本政府宣布，位于F岛的核电站，受9级特大地震影响，放射性物质发生泄漏。R本人自食恶果不足惜，却给世界环境...
茶点故事阅读 38,890评论 3赞 307
男人毒药：我在死后第九天来索命
文/蒙蒙一、第九天我趴在偏房一处隐蔽的房顶上张望。院中可真热闹，春花似锦、人声如沸。这庄子的主人今日做“春日...
开封第一讲书人阅读 29,896评论 0赞 19
一桩弑父案，背后竟有这般阴谋
文/苍兰香墨我抬头看了看天上的太阳。三九已至，却和暖如春，着一层夹袄步出监牢的瞬间，已是汗流浃背。一阵脚步声响...
开封第一讲书人阅读 31,137评论 1赞 259
情欲美人皮
我被黑心中介骗来泰国打工，没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留，地道东北人。一个月前我还...
沈念sama阅读 42,796评论 2赞 349
代替公主和亲
正文我出身青楼，却偏偏与公主长得像，于是被迫代替她去往敌国和亲。传闻我的和亲对象是个残疾皇子，可洞房花烛夜当晚...
茶点故事阅读 42,335评论 2赞 342

Python采集B站最新周杰伦MV内容, 粉丝评论 并实现词云分析

前言