
jionlp数据分析
V1
2022/11/08阅读:36主题:默认主题
豆瓣评论【数据集分享】-脱口秀大会5

相信很多做自然语言处理、数据分析的小伙伴们都接触过豆瓣评论数据集。
最近 《脱口秀大会5》 比较火,所以我就抓去了一份《脱5》的豆瓣短评数据集,样例如下表所示:
{
"comment_time": "2022-11-02 22:37:41",
"comment_score": "很差",
"comment_vote": "21",
"comment_content": "\"不敢说所有,至少有一部分人初心变了。不好笑不要赖观众,心思都放在稿子和段子上了吗,那广告接得,秀走得,不好笑也正常啊。\"",
"comment_username": "江湖谝子"
}
-
其中, comment_score
表示豆瓣评分,总共五颗星,对应总分为 10分。每一颗星对应2分。 不同星数对应的中文描述为:
{
'力荐': 5,
'推荐': 4,
'还行': 3,
'较差': 2,
'很差': 1
}
-
comment_vote
代表的是有多少人赞同这条短评。
其实,豆瓣网站有严格的数据获取限制,用户仅仅能访问最热门的短评数据集共计 600
条。然后再进行翻页,网站系统则会禁止。
同时豆瓣也仅提供 200
条最新的短评。根据这些数据,我做了一个加权统计,《脱5》的豆瓣加权平均分仅仅有3.3分。口碑大大滑坡。

我还对《脱5》的豆瓣评论做了详细的数据分析,感兴趣可以看看。数据集以 json 格式给出。有需要的小伙伴可以关注下面公众号自取。
步骤如下:
-
1 关注微信gong---zhong号JioNLP -
2 回复【脱口秀大会5】获取下载链接 -
3 该数据集是免费的
如何在程序中加载
如果有编程经验,可以用python进行操作
-
1 安装 jionlp 工具包
$ pip install jionlp
-
2 编写以下代码执行
import jionlp as jio
comment_list = jio.read_file_by_line(/path/to/short_comment_has_watched_highest_tuokouxiudahui5.txt) # 解压后替换为下载路径
数据将定期更新,未来也会根据国务院的行政区划调整进行重新抓取。
我已经把数据集公开出来,可以扫码关注微信gong---zong号JioNLP,回复脱口秀大会5获取。
JioNLP 是一个专注挖掘并分析互联网数据的gong---zhong号,还想要什么数据集?来看看这里有没有你想要的数据吧。
本文由mdnice多平台发布
作者介绍

jionlp数据分析
V1
jionlp开源作者,数据分析专家