十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

如何构建一个6500万条微博舆情数据集?Weibo-COV论文(EMNLP2020)方法论全解读

如何构建一个6500万条微博舆情数据集?Weibo-COV论文(EMNLP2020)方法论全解读 如何构建一个6500万条微博舆情数据集Weibo-COV论文EMNLP2020方法论全解读【免费下载链接】weibo-covWeibo-COV: A Large-Scale COVID-19 Social Media Dataset from Weibo项目地址: https://gitcode.com/gh_mirrors/we/weibo-covWeibo-COV 是由华中科技大学团队构建的大规模 COVID-19 微博舆情数据集论文发表于EMNLP 2020 NLP4COVID 工作坊收录6500 万条疫情相关微博。它演示了从关键词体系设计 → 十亿级原始数据筛选 → 用户隐私脱敏的完整数据集构建方法论是学习舆情数据挖掘和社交媒体 NLP 研究的绝佳范本。本文带你逐步拆解这套方法论 。一、Weibo-COV 是什么两个版本的核心指标Weibo-COV 经历了两次迭代规模差异一目了然版本时间跨度关键词数原始微博量最终收录量1.02019-12 ~ 2020-04179 个6.93 亿条4089 万条2.02019-12 ~ 2020-12通用 月度动态26.15 亿条6517 万条 2.0 版还额外发布了2000 万微博活跃用户池脱敏后方便做用户画像与传播研究。二、方法论第一步设计舆情关键词体系整个数据集的地基是关键词过滤Keyword Filtering。团队没有简单堆砌疫情新冠这类大词而是分层设计1. 基础版179 个静态关键词1.0 版使用 keywords/Weibo-COV.txt 中固定的179 个关键词覆盖多个维度病原与命名冠状、Cov-19、#2019nCoV、#nCoV、Coronavirus机构与地标武汉病毒所、CDC、中国疾病预防控制中心、武汉卫健委防控动作PHEIC、隔离14天、居家隔离、潜伏期、复工社会热点双黄连 抢购、武汉 封城2. 进阶版通用 月度动态关键词2.0 版的关键词文件 keywords/Weibo-COV-V2.txt 达到491 行采用common 通用词 当月专属词的组合策略每月用通用词与该月专属词共同过滤当月微博。以文件末尾的月度词为例可以看到热点随时间自然漂移顺义 一级防控、冷链食品 核酸检测、聚集性场所 测温验码、新冠疫苗 医保名录……这种动态更新让数据集在一年跨度内始终贴合真实舆情走向 。三、方法论第二步从 26 亿条原始微博中精准筛选关键词匹配看似简单工程难点在于十亿级数据的规模2.0 版扫描了2,615,185,101 条带 GEO 标签的原始微博最终命中65,175,112 条命中率约2.5%——说明关键词体系收得紧噪声可控作为对照1.0 版从 6.93 亿条中筛出 4089 万条方法一致只是时间窗口更短。筛选后的每条微博以 CSV 形式存储包含10 个字段字段含义_id微博唯一标识user_id用户标识哈希脱敏后的值crawl_time爬取时间戳created_at微博发布时间like_num/repost_num/comment_num点赞、转发、评论数传播力指标content微博正文含转发理由origin_weibo原微博 ID可用于传播链重建geo_info地理位置信息四、方法论第三步隐私保护与数据脱敏大规模社交数据最敏感的问题是个人信息安全。Weibo-COV 的做法非常克制user_id全部替换为原始 ID 的哈希结果无法逆向还原真实账号2000 万用户池同样经过脱敏见 readme.md 中的字段样例仅保留性别、省市、粉丝量、VIP 等级等研究所需维度。这套哈希化 字段最小化原则如今仍是公共数据发布的通行标准 。五、如何获取并使用 Weibo-COV 数据集获取方式很简单一条命令拉取仓库git clone https://gitcode.com/gh_mirrors/we/weibo-cov仓库内 keywords/Weibo-COV.txt 与 keywords/Weibo-COV-V2.txt 即论文所用的全部过滤关键词可复现筛选逻辑完整数据6500 万条微博 用户池的下载入口与更新日志News均维护在 readme.md 中数据集采用MIT License见 LICENSE学术研究自由使用。典型研究方向疫情舆情演化分析、情绪与立场分类、谣言/虚假信息检测、用户传播行为建模、热点话题发现等。据项目更新记录该数据集已支持200 个研究项目。六、论文引用信息如果你在自己的研究中使用了该数据集可引用其 EMNLP 2020 论文Hu, Y., Huang, H., Chen, A., Mao, X.-L. (2020).Weibo-COV: A Large-Scale COVID-19 Social Media Dataset from Weibo. Proceedings of the 1st Workshop on NLP for COVID-19 (Part 2) at EMNLP 2020.完整 BibTeX 引文格式可在 readme.md 的 Citation 一节直接复制。总结可复用的数据集构建方法论回顾 Weibo-COV 的完整流程可以沉淀为四步通用范式分层关键词设计——静态基础词 动态月度词兼顾召回与时效大规模过滤——从 26 亿条中命中 6500 万条~2.5% 的命中率验证了体系的有效性️脱敏最小化——哈希 ID 字段最小化平衡隐私与研究价值元数据公开——关键词表、字段说明全部随仓库开源方法可复现。无论你要构建疫情、财经还是体育领域的舆情数据集这套关键词工程 规模过滤 隐私合规的方法论都直接可迁移。【免费下载链接】weibo-covWeibo-COV: A Large-Scale COVID-19 Social Media Dataset from Weibo项目地址: https://gitcode.com/gh_mirrors/we/weibo-cov创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表