jionlp数据分析

V1

2022/11/08阅读:36主题:默认主题

豆瓣评论【数据集分享】-脱口秀大会5

相信很多做自然语言处理、数据分析的小伙伴们都接触过豆瓣评论数据集

最近 《脱口秀大会5》 比较火,所以我就抓去了一份《脱5》的豆瓣短评数据集,样例如下表所示:

{
  "comment_time""2022-11-02 22:37:41"
  "comment_score""很差"
  "comment_vote""21"
  "comment_content""\"不敢说所有,至少有一部分人初心变了。不好笑不要赖观众,心思都放在稿子和段子上了吗,那广告接得,秀走得,不好笑也正常啊。\""
  "comment_username""江湖谝子"
}
  • 其中,comment_score表示豆瓣评分,总共五颗星,对应总分为 10分。每一颗星对应2分。 不同星数对应的中文描述为:
{
  '力荐': 5, 
  '推荐': 4, 
  '还行': 3, 
  '较差': 2, 
  '很差': 1
}
  • comment_vote 代表的是有多少人赞同这条短评。

其实,豆瓣网站有严格的数据获取限制,用户仅仅能访问最热门的短评数据集共计 600 条。然后再进行翻页,网站系统则会禁止。

同时豆瓣也仅提供 200 条最新的短评。根据这些数据,我做了一个加权统计,《脱5》的豆瓣加权平均分仅仅有3.3分。口碑大大滑坡。

我还对《脱5》的豆瓣评论做了详细的数据分析,感兴趣可以看看。数据集以 json 格式给出。有需要的小伙伴可以关注下面公众号自取。

步骤如下:

  • 1 关注微信gong---zhong号JioNLP
  • 2 回复【脱口秀大会5】获取下载链接
  • 3 该数据集是免费的

如何在程序中加载

如果有编程经验,可以用python进行操作

  • 1 安装 jionlp 工具包
$ pip install jionlp
  • 2 编写以下代码执行
import jionlp as jio
comment_list = jio.read_file_by_line(/path/to/short_comment_has_watched_highest_tuokouxiudahui5.txt)  # 解压后替换为下载路径

数据将定期更新,未来也会根据国务院的行政区划调整进行重新抓取。

我已经把数据集公开出来,可以扫码关注微信gong---zong号JioNLP,回复脱口秀大会5获取。

JioNLP 是一个专注挖掘并分析互联网数据的gong---zhong号,还想要什么数据集?来看看这里有没有你想要的数据吧。

本文由mdnice多平台发布

分类:

人工智能

标签:

数据挖掘

作者介绍

jionlp数据分析
V1

jionlp开源作者,数据分析专家