十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

社交媒体数据采集工具MediaCrawler-new使用指南:一条命令打通小红书、抖音、快手、B站与微博

社交媒体数据采集工具MediaCrawler-new使用指南:一条命令打通小红书、抖音、快手、B站与微博 社交媒体数据采集工具MediaCrawler-new使用指南一条命令打通小红书、抖音、快手、B站与微博【免费下载链接】MediaCrawler-new项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler-new深夜十一点市场部的小林还在对着浏览器发呆。她需要为下季度的内容方案收集竞品的五十条爆款笔记以及评论区里用户反复提到的高频词汇。复制、粘贴、翻页、滚动半小时才收了六条中途还被平台的验证码拦下两次。她忍不住想难道没有一种办法能像打开水龙头一样让数据自己流进表格里吗答案是有的。开源项目MediaCrawler-new正是一款面向普通人的多平台数据采集工具它把小红书、抖音、快手、B站、微博五家主流平台的笔记、视频、评论、互动数据统一收纳进同一套流程里你只需要写好一行命令剩下的交给它去跑。这套工具基于 Playwright 浏览器自动化技术用真实浏览器的身份与平台打交道绕过了绝大多数反爬限制也让普通用户免去了逆向 JS 加密算法的痛苦。它解决什么问题又强在哪里一句话总结这是一台社交媒体数据采集总开关同一套配置即可在五大平台之间无缝切换且免写逆向代码、免研究签名算法。同类方案里单平台脚本满天飞但能同时覆盖五个平台、且把登录、抓取、存储、代理这些环节全部封装好的并不多见。MediaCrawler-new 的价值不在于某个单点功能有多花哨而在于它把从登录到拿到结构化数据的整条链路压缩成了几个配置文件——这对时间有限、又不想碰底层逆向的普通用户来说是实打实的省心。三分钟跑通第一趟数据采集任务先别急着研究源码上手是唯一重要的事。这套工具的安装路径非常平坦全程只需要几步。# 获取项目代码 git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler-new cd MediaCrawler-new # 创建并激活虚拟环境 python -m venv venv source venv/bin/activate # 安装依赖与浏览器驱动 pip install -r requirements.txt playwright install依赖装好后打开config/base_config.py做两处最核心的调整把PLATFORM改成你想采集的平台标识xhs、dy、ks、bili、wb五选一把KEYWORDS填成你想搜索的关键词。PLATFORM xhs # 当前要采集的平台 KEYWORDS 露营,城市周边游 # 搜索关键词英文逗号分隔 LOGIN_TYPE qrcode # 登录方式qrcode / phone / cookie保存后运行这条命令浏览器会自动弹出二维码用手机 App 扫码之后采集便自动开始了python main.py --platform xhs --lt qrcode --type search第一条数据落地时你会看到程序在终端里持续输出抓取进度而data/目录下已经躺着结构清晰的采集结果。从下载到出数据整个过程用不了几分钟——这就是零门槛的含义。能力拆解四个维度看懂它的全部底牌与其按平台逐个介绍功能不如按能力维度来理解这套工具的设计逻辑你会发现它的功能其实高度内聚。维度一身份验证与登录——三种姿势随取随用平台的访问门槛主要卡在登录环节MediaCrawler-new 准备了三种通行方式二维码登录浏览器自动弹出二维码手机扫码即完成适合首次使用。手机号登录配合短信转发服务验证码自动回填适合需要长期稳定采集的场景相关说明见docs/手机号登录说明.md。Cookie 登录填入已有的 Cookie 即可免登录启动适合批量任务快速复用。更贴心的是登录状态默认会被缓存到本地浏览器数据目录。今天扫码登录一次明天再跑任务直接跳过登录环节。对于触发滑块验证的平台如抖音工具内置了滑块处理逻辑实在过不去时可以把HEADLESS设为False打开真实浏览器窗口手动滑一次。维度二数据获取与解析——三种采集模式覆盖日常需求登录之后采集器提供三种猎物定位方式关键词搜索围绕某个主题词抓取相关笔记或视频适合做话题热度扫描。指定 ID 采集在XHS_SPECIFIED_ID_LIST、BILI_SPECIFIED_ID_LIST等列表里填上具体内容 ID就能定向抓取某一条帖子的完整详情与评论适合追踪特定内容。创作者主页采集填入创作者 ID把该账号下的全部作品一网打尽适合分析头部账号的内容策略。评论、点赞、转发等互动数据也一并支持只需在配置中把ENABLE_GET_COMMENTS打开。维度三存储与导出——数据放哪你说了算抓到的数据不是堆在内存里的死数据而是提供三种落地方式JSON结构化完整适合程序化二次加工也是默认选项。CSVExcel 直接打开适合快速浏览和简单统计。关系型数据库MySQL、PostgreSQL 均支持连接信息在config/db_config.py中配置适合大规模数据入库后的复杂查询。维度四批处理与自动化——并发、频率与 IP 轮换采集规模一旦上来单线程就会变成瓶颈。工具内置了并发控制参数MAX_CONCURRENCY_NUM配合CRAWLER_MAX_NOTES_COUNT限制单次任务的抓取总量。而真正让批量任务跑得久的是内置的代理 IP 池系统。![社交媒体数据采集工具代理IP工作流程](https://raw.gitcode.com/GitHub_Trending/me/MediaCrawler-new/raw/387f08701788e8e626b688ecf6ef50f669a80b75/static/images/代理IP 流程图.drawio.png?utm_sourcegitcode_repo_files)代理 IP 的运作链路清晰从代理服务商处拉取 IP → 存入 Redis 缓存 → 组成 IP 池 → 采集时从中随机取用过期自动回收。整个流程由proxy/proxy_ip_pool.py与proxy/proxy_ip_provider.py协同实现你只需要在配置里把ENABLE_IP_PROXY打开并设置池子大小IP_PROXY_POOL_COUNT即可。如果你使用极速 HTTP 这类代理服务商只需在其后台生成带参数的提取链接把 key 与 crypto 通过环境变量注入避免把密钥写死在代码里工具就能自动拉取、验证并轮换可用 IP。密钥配置方式可参考下图实战演示三个场景把工具用出价值场景一美妆行业市场调研假设你是一家新消费品牌的产品经理想了解小红书上用户对持妆粉底液的真实评价。操作路径是把PLATFORM设为xhs关键词填上持妆粉底液,油皮粉底液ENABLE_GET_COMMENTS打开跑一次搜索任务。得到的笔记与评论经过简单分词就能整理出用户反复提及的槽点与优点——这比手动翻几百条评论高效太多了。场景二内容创作者的选题雷达做抖音短视频的运营最头疼的是不知道今天该拍什么。把平台切到dy用美食探店这类关键词跑一轮搜索再结合点赞、评论数据排序就能看出近期哪些内容方向最受欢迎。创作者本人也可以把自己的账号 ID 填入采集列表定期复盘自己作品的互动表现。场景三学术研究的语料积累研究社交平台舆论传播的课题组往往需要成规模的公开讨论数据。这时可以把数据出口切到数据库SAVE_DATA_OPTION db用CRAWLER_MAX_NOTES_COUNT控制样本量分平台、分批次地把公开帖文与评论沉淀下来后续直接用 SQL 做统计分析。工具的模块化结构media_platform/下每个平台一个独立包也方便研究者按需扩展。避坑指南常见报错与调优清单再顺手的工具也有脾气以下几条是高频踩坑点建议收藏抖音报错 缺少 ;缺 Node.js 环境安装 v16.8.0 及以上版本即可这是 Playwright 执行加密脚本的前提。Playwright 超时Timeout 30000ms exceeded多半是网络问题检查代理或网络环境是否稳定。采集一段时间后失效账号大概率触发了平台风控。此时应降低频率、减小单批数量而不是硬刚。更换登录账号删除项目根目录下的browser_data/目录重新扫码登录即可。跑得快不如跑得稳并发数从 4 起步慢慢调请求间隔合理放大配合代理 IP 轮换比一次性拉满更不容易被封。大任务优先入库数据量级大时别用 CSV切到数据库存储查询和续采都方便。边界与责任数据采集的前提是克制必须强调任何采集工具的使用都有明确边界。合规红线请仔细阅读各平台的服务条款仅采集公开可见的数据不要触碰隐私信息。频率克制设置合理的采集间隔与总量避免对平台服务器造成压力。工具的免责声明也明确本项目仅限学习与研究用途。用途正当采集到的数据只应用于学术研究、市场分析等合法场景不用于任何商业牟利或侵权用途。技术本身是中性的决定价值的永远是使用方式。把采集频率当成节流阀比当成油门更符合长期主义。下一步现在就动手如果你已经看到这里说明这套工具确实戳中了你的某个需求。接下来的行动清单很简单克隆代码、创建虚拟环境、安装依赖与浏览器驱动。打开config/base_config.py选定平台与关键词。运行python main.py --platform xhs --lt qrcode --type search扫码完成第一次采集。跑通后再按需调整评论开关、存储方式、代理 IP 与并发参数。查阅docs/目录下的常见问题与手机号登录说明把体验打磨到顺手。数据不会自己跑到表格里但它可以。用一套工具、几条命令把五平台的数据获取效率提升一个量级——这件事今天就能开始。【免费下载链接】MediaCrawler-new项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler-new创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表