
MediaCrawler 使用教程3 条命令跑通 7 平台社媒数据采集【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawlerMediaCrawler 是一个 7 平台自媒体数据爬虫用真实浏览器完成登录与签名不需要 JS 逆向就能把小红书、抖音、B站、快手、微博、贴吧、知乎的笔记/视频内容和评论批量导出成 JSON、Excel 或数据库。适合做选题调研、竞品监控的运营同学以及不想自己写签名逻辑、想要现成采集框架的开发者。先确定你要哪种数据改任何配置之前先回答数据从哪里来。项目把数据来源抽象成 3 种方式所有平台共用同一个CRAWLER_TYPE开关方式CRAWLER_TYPE 取值你需要输入得到的数据关键词搜索searchKEYWORDS里的关键词该话题下的笔记/视频列表及其评论指定帖子detail平台配置文件里的 URL/ID 列表单条内容的完整字段与评论创作者主页creator平台配置文件里的主页 URL 列表该创作者发布的全部内容以小红书为例detail模式的笔记链接必须带xsec_token参数——直接从浏览器地址栏复制完整 URL 即可别手动截断。数据来源定了后面所有配置都是确定性的。你得到的是一张输入→产出的映射表后面照着填就行。安装 MediaCrawler 的两个运行时依赖硬性依赖只有 Python 3.11 以上和 uv 包管理器如果还要爬抖音、知乎需提前装好 Node.jsv16 及以上因为这两个平台的签名逻辑靠 JS 表达式在 Node 环境里执行。git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler uv syncuv sync一条命令装完全部依赖它会自动锁定 Python 版本和依赖包版本。只爬小红书、微博、B站的话Node.js 可以完全跳过。装完之后你得到一个开箱即用的项目目录——不用再折腾 pip 版本对不上的问题。修改 4 个核心配置项跑第一次采集不用了解项目目录结构改一个文件里的 4 处就能跑。开关都在 config/base_config.pyPLATFORM xhs # xhs|dy|ks|bili|wb|tieba|zhihu KEYWORDS 咖啡测评 # 多个关键词用英文逗号分隔 CRAWLER_TYPE search # search|detail|creator SAVE_DATA_OPTION json # json|csv|excel|sqlite|postgres然后执行uv run main.py --platform xhs --lt qrcode --type search。首次运行会弹出浏览器用对应 App 扫码登录也支持手机号LOGIN_TYPE可切phone。登录状态会存到本地浏览器数据目录之后运行免扫码跑完去data/目录看结果文件。不想敲命令也行项目自带可视化控制台页面上直接配参数、看日志、预览数据这次跑通后你拿到的是第一批数据和一个可复用的登录态——登录态是后面所有操作省时间的关键。开启 Chrome 远程调试复用已有登录态项目默认的反检测策略是 CDP 模式不新开浏览器实例而是直连你日常在用的 Chrome复用真实 Cookie、扩展和浏览历史平台很难把这次请求和普通用户区分开。配置里ENABLE_CDP_MODE与CDP_CONNECT_EXISTING默认都是True你只需要打开浏览器侧的调试端口Chrome 地址栏输入chrome://inspect/#remote-debugging版本需 144 以上chrome://version可查勾选 Allow remote debugging for this browser instance页面出现Server running at: 127.0.0.1:9222即就绪。运行爬虫时 Chrome 会弹确认对话框点接受即可程序会在 60 秒内等待人工确认。完整说明见 CDP 模式使用指南。真实浏览器的登录态加浏览历史是最强反检测组合。做完这步账号触发风控的概率比全新浏览器环境低得多。按数据去向选存储格式SAVE_DATA_OPTION控制数据出口选型逻辑不是哪个快而是谁消费这些数据格式适合场景json/jsonl一次性分析后续用 Python 处理jsonl 逐行追加、写入更快excel/csv直接发给非技术同事打开看sqlite/postgresMySQL 用db长期反复采同一批对象入库自动建表并去重mongodb数据量大时的扩展方案数据库模式先用--init_db初始化再跑任务首次运行不会遇到表不存在的报错。各格式细节见 数据存储指南。选完之后数据落地就是下游能直接消费的形态——不会再卡在导出给谁、用什么打开上。打开评论、词云与代理池这三项能力默认都是关的按需打开。评论相关开关先说因为它们是数据集里最有价值的部分ENABLE_GET_COMMENTS True # 一级评论默认开启 CRAWLER_MAX_COMMENTS_COUNT_SINGLENOTES 10 # 单篇内容评论上限 ENABLE_GET_SUB_COMMENTS False # 二级评论 ENABLE_GET_WORDCLOUD True # 用评论数据生成词云词云依赖停用词表把不需要出现的词一行一个写进docs/hit_stopwords.txt字体用项目内置的中文 TTF不用额外配。完整用法见 词云图使用配置。量级再往上走时单 IP 高频请求很容易被风控。proxy/目录内置了代理池启动时从服务商拉一批 IP逐个验证可用性后随机轮换失效自动补新。把ENABLE_IP_PROXY True再给IP_PROXY_PROVIDER_NAME选一家服务商快代理、豌豆 HTTP、极速 HTTP、静态代理共 4 种即可。以快代理为例先在服务商后台开通免费试用服务商提供的用户名密码通过环境变量注入项目不写在代码里具体环境变量名与隧道/普通代理的选型见 代理使用。这三个开关配好你得到的不再只是数据列表而是带评论量、情绪词云和持续放量能力的完整采集集。排查 4 类运行失败实际跑采集时遇到的失败就这 4 类按现象对号入座小红书扫码后反复弹滑块、登录卡死因为环境被风控盯上。确认 CDP 连的是真实浏览器而非无痕窗口把HEADLESS设为False重启在弹出的浏览器里手动过一次滑块仍不行就删掉项目根目录的brower_data/浏览器数据目录重新登录。execjs 或 JS 执行报错主要出现在抖音、知乎因为缺 Node.js。装 v16 及以上版本重启终端再跑不用改任何配置。之前正常跑一段时间后抓不到数据因为账号触发了平台风控这是最常见的原因。把CRAWLER_MAX_SLEEP_SEC请求间隔默认 2 秒加到 3~5 秒调小单次采集条数开代理池分散 IP还不行就删浏览器数据目录换账号避开短期频繁操作过的账号。CDP 连不上 9222 端口或 playwright 超时检查 Chrome 是否在运行且版本 144 以上、调试开关已勾选、页面出现Server running at: 127.0.0.1:9222弹出确认框的话 60 秒内点接受。⚠️前两类是环境问题后两类是节奏问题。都排查完仍卡住就逐项对照 常见问题。一句话回顾MediaCrawler 的使用方式就是改几个配置、跑一条命令7 个平台的内容和评论数据直接落进文件。你的下一步克隆仓库改完base_config.py里的 4 项今天就拿到第一个数据文件。【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考