ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

如何用MediaCrawler从零跑通多平台自媒体采集

如何用MediaCrawler从零跑通多平台自媒体采集 如何用MediaCrawler从零跑通多平台自媒体采集【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawlerMediaCrawler 是一个开源的自媒体数据采集工具覆盖小红书、抖音、快手、B站、微博、贴吧、知乎七个平台的公开内容与评论抓取签名全部在浏览器里完成不用看一行 JS 逆向。这篇讲装环境、跑任务、算成本按实际用过的顺序来说。 装依赖uv、Node.js 和 Chrome 上的一个开关先克隆仓库装好依赖uv 没装过的话先补上它保证 Python 版本和包的一致性比 pip 省心。git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler uv sync还有一件事容易漏Chrome 要 144 以上版本并且在地址栏打开chrome://inspect/#remote-debugging勾选允许远程调试。项目默认开 CDP 模式直接连你日常在用的那个 Chrome复用真实的 Cookie、扩展和浏览历史反检测效果是几种方式里最好的连 playwright 驱动都不用装。不想用自己的浏览器就把config/base_config.py里的ENABLE_CDP_MODE改成 False再补一条uv run playwright install。也嫌命令行麻烦的话起好后端再构建 webui 前端可以纯图形化操作界面长这样 二维码登录的两种姿势登录有三种方式qrcode、phone、cookie最省事的还是扫码。跑一条命令就行uv run main.py --platform xhs --lt qrcode --type search浏览器弹出来用对应 App 扫。中间会弹一个确认对话框60 秒内点掉。SAVE_LOGIN_STATE默认是 True登录态会写进按平台区分的浏览器缓存目录比如 xhs_user_data_dir第二次运行一般不用重扫。两个坑小红书扫码反复失败时把HEADLESS设为 False浏览器里会出滑块手动拖一下抖音扫码后可能追一个手机验证也得手动过。登录态过期别硬扛重新扫一遍就行这是它设计上就接受的成本。 采集数据存哪里四种格式怎么选数据默认落在data/目录格式由--save_data_option参数决定。可选值有七种实际常用的是四种格式适用场景jsonl默认追加写入批量后处理最稳excel内容、评论、创作者三个工作表带格式化直接看sqlite免服务器想写 SQL 查询时用mysql / postgres要接数据库、要自动去重、上生产时用走数据库路线的话先单独跑一次uv run main.py --init_db sqlite初始化表结构再带上对应参数采集。个人分析 jsonl 配 pandas 就够用数据量上来之后才值得进数据库。各平台在store/目录下都有独立的存储实现想扩自己的落地方式照着这个结构写一份就行。 代理池失效时的排查顺序代理挂了先别怀疑爬虫本身。整个链路是启动时向服务商拉 IP写入 Redis 缓存取用时从池里拿失败就换 IP 重试。![MediaCrawler代理IP池工作流程](https://raw.gitcode.com/GitHub_Trending/me/MediaCrawler/raw/5665a271ef15e0ec82b1f48a951b66760e054db9/docs/static/images/代理IP 流程图.drawio.png?utm_sourcegitcode_repo_files)排查按这个顺序来先确认服务商账户还有额度再查 Redis 里池子是不是真灌满了 IP最后如果你是 static 模式检查STATIC_PROXY_URL的格式——地址里可以直接带账号密码。服务商名字填在IP_PROXY_PROVIDER_NAME可选 kuaidaili、wandouhttp、static 三种。想知道实际从哪拿 IP、拿到手怎么处理可以看这张提取示意图另外两个参数ENABLE_IP_PROXY是总开关IP_PROXY_POOL_COUNT控制池子大小。小样本采集其实不用开代理家用 IP 直接跑反而不容易被风控盯上。⏱️ 一次完整采集的成本估算默认配置其实很克制CRAWLER_MAX_NOTES_COUNT 15即一次搜索抓 15 篇笔记每篇最多收 10 条一级评论并发是 1请求间隔在秒级。这套参数跑下来含浏览器启动一次任务大概几分钟的量级产出十几行到百来行不等的 jsonl 数据。真正的开销在别处。打开ENABLE_GET_MEIDAS下图片和视频时间和磁盘会再翻一个量级用付费代理的话成本就是 IP 额度小样本不如省下。最大的隐性成本是维护——平台接口会变偶尔会碰到解析失败得等修复或者自己上手改这部分没有任何工具能替你省掉。频率控制与合规的三句话并发别乱堆MAX_CONCURRENCY_NUM 1是保守的默认值想调大就先确认代理额度扛得住。内置的请求间隔保留着别为了提速去极限压缩。项目许可证限学习研究用途明确禁止商业用途抓下来的虽然都是公开内容但怎么使用是你自己的责任——控制频率、尊重平台规则、不碰隐私数据。第一个任务不用搞得很大挑一个关键词抓 15 篇把数据跑出来看一眼再决定要不要加料。你接下来最想抓的是哪个平台【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表