python带你采集MP4、弹幕、评论数据并制作词云图~- Python

前言 ?

大家早好、午好、晚好吖~

代码提供者: 青灯教育-自游

环境使用:

Python 3.8
Pycharm 2021.2版本
ffmpeg <需要设置环境变量>
软件的使用: 合成视频和音频

需要 ffmpeg 软件找落落老师v: xinlian_00

模块使用]:

import requests >>> pip install requests

内置模块你安装好python环境就可以了

import re
import json
import subprocess

如果安装python第三方模块:

win + R 输入 cmd 点击确定, 输入安装命令 pip install 模块名 (pip install requests) 回车
在pycharm中点击Terminal(终端) 输入安装命令

基本思路流程:

采集视频数据… 1. 视频标题 2. 视频内容

对着网页鼠标右键点击查看网页源代码 ctrl + F 搜索 playinfo

代码实现步骤: <通用>

发送请求, 模拟浏览器对于url地址发送请求
获取数据, 获取网页源代码 <因为我们想要数据内容, 来自于网页源代码>
解析数据, 提取我们想要数据内容
保存数据, 把视频内容完整的保存到本地文件夹

采集MP4代码

模块导入

# 导入数据请求模块
import requests
# 导入正则
import re
# 导入json
import json
# 导入格式化输出模块
import pprint
# 导入进程模块
import subprocess
2
3
4
5
6
7
8
9
10

发送请求, 模拟浏览器对于url地址发送请求

获取数据得到响应对象文本数据 —> 字符串数据类型

# print(response.text)

解析数据, 提取我们想要数据内容

正则表达式 re —> 对于字符串数据进行提取

—> 0 1 2 开始计数 -3 -2 -1<—

lis = [‘a’, ‘b’, ‘c’] lis[0] lis[-3]

re.findall() --> 匹配数据返回列表数据类型列表取值: 根据索引位置提取内容

.findall() 调用re模块里面findall()方法 --> 找到所有 <我们想要数据>

从什么地方去找什么数据

从 response.text 里面去找 "title":"(.*?)","pubdate" 其中 (.*?) 这段是我们想要的

获取标题

title = re.findall('"title":"(.*?)","pubdate"', response.text)[0].replace(' ', '')

正则替换特殊字符

title = re.sub(r'[\/:*?"<>|]', '', title)

获取视频数据信息

html_data = re.findall('<script>window.__playinfo__=(.*?)</script>', response.text)[0]

转成json字典数据类型

json_data = json.loads(html_data)

字典取值 --> 键值对取值, 根据冒号左边内容[键] 提取冒号右边的内容[值]

audio_url = json_data['data']['dash']['audio'][0]['baseUrl']
video_url = json_data['data']['dash']['video'][0]['baseUrl']
print(audio_url)
print(video_url)
print(title)
2
3
4
5

保存数据

–> 403 Forbidden 没有访问权限 --> 防盗链加headers请求头

# 发送请求 获取音频二进制数据
audio_content = requests.get(url=audio_url, headers=headers).content
# 发送请求 获取视频二进制数据
# video__content = requests.get(url=video_url, headers=headers).content
# with open('video\\' + title + '.mp3', mode='wb') as a:
#     a.write(audio_content)
# with open('video\\' + title + '.mp4', mode='wb') as v:  # 丨
#     v.write(video__content)

# 通过ffmpeg 这个软件命令 进行视频合成
cmd = f"ffmpeg -i video\\{title}.mp4 -i video\\{title}.mp3 -c:v copy -c:a aac -strict experimental video\\{title}output.mp4"
subprocess.run(cmd, shell=True)
2
3
4
5
6
7
8
9
10
11
12

效果

采集评论代码

源码、解答、教程加Q裙：261823976 点击蓝字加入【python学习裙】

请添加图片描述

导入数据请求模块

import time
import requests
2

加入伪装

发送请求

response = requests.get(url=url, headers=headers)

获取数据

content_list = [i['content']['message'] for i in response.json()['data']['replies']]
print(content_list)
# for 遍历输出内容
for content in content_list:
    with open('评论.txt', mode='a', encoding='utf-8') as f:
        f.write(content)
        f.write('\n')
    print(content)
2
3
4
5
6
7
8

效果

采集弹幕代码

导入模块

# 导入数据请求模块
import requests
# 导入正则
import re
2
3
4

发送请求

response = requests.get(url=url, headers=headers)

解决网页数据乱码

response.encoding = 'utf-8'

获取数据

print(response.text)

解析数据

content_list = re.findall('<d p=".*?">(.*?)</d>', response.text)
print(content_list)
# for 遍历输出内容
for content in content_list:
    with open('弹幕.txt', mode='a', encoding='utf-8') as f:
        f.write(content)
        f.write('\n')
    print(content)
2
3
4
5
6
7
8

效果

词云图代码

# 导入结巴分词模块
import jieba
# 导入词云模块
import wordcloud
# 读取文件内容
f = open('评论.txt', encoding='utf-8')
txt = f.read()
print(txt)
string = ' '.join(jieba.lcut(txt))
print(string)
wc = wordcloud.WordCloud(
    width=700,   # 宽
    height=700,  # 高
    background_color='white',  # 背景颜色
    font_path='msyh.ttc',  # 设置字体
    scale=15,  # 规模
)
wc.generate(string)
wc.to_file('评论词云.png')
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19