拓冰建站拓冰建站
首页 / 资讯中心 / 正文

MediaCrawler 上手指南:5 步完成自媒体平台数据采集

MediaCrawler 上手指南5 步完成自媒体平台数据采集【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawlerMediaCrawler 是一款开源的多平台自媒体数据采集工具覆盖小红书、抖音、快手、B站、微博、贴吧、知乎 7 个平台能按关键词、指定帖子 ID 或创作者主页三种方式抓取内容数据与评论数据。它不依赖手动逆向接口加密而是借浏览器环境完成登录与签名适合想低成本获取社媒公开数据做分析的新手。 先搞懂原理为什么不用碰 JS 逆向多数爬虫项目的门槛在接口签名——小红书、抖音的请求参数都经过加密手写逆向耗时且易失效。MediaCrawler 的做法是绕开这一步基于 Playwright 把登录态保存在浏览器上下文里签名参数直接通过浏览器内的 JS 表达式获取。你只需要像普通用户一样扫码登录一次后续请求复用这份登录状态。默认配置还开启了 CDP 模式ENABLE_CDP_MODE True程序直接连接你本机正在使用的 Chrome版本需 ≥ 144复用其中真实的 Cookie、扩展和浏览历史比新启动一个干净浏览器更难被平台风控识别。7 个平台的能力完全一致关键词搜索、指定帖子、二级评论、创作者主页、登录态缓存、IP 代理池、评论词云全平台通用。⏱️ 五分钟完成首次配置前置依赖只有三样Python 包管理器 uv、Node.js ≥ 16抖音和知乎的签名计算依赖它执行 JS 脚本、最新版 Chrome。依次执行下面命令克隆项目并安装依赖git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler uv sync接着开启 Chrome 远程调试地址栏输入chrome://inspect/#remote-debugging勾选 Allow remote debugging for this browser instance看到Server running at: 127.0.0.1:9222即就绪。只有切换回标准 Playwright 模式ENABLE_CDP_MODE False时才需要额外执行uv run playwright install安装浏览器驱动。一切就绪后跑第一条采集命令用小红书 App 扫弹出的二维码即可uv run main.py --platform xhs --lt qrcode --type search数据默认以 JSONL 格式追加写入data/目录。️ 配置采集策略三个必改参数所有可调项集中在 config/base_config.py每个参数都有中文注释首次使用重点看三个参数作用默认值KEYWORDS关键词搜索词英文逗号分隔示例词需改成你自己的CRAWLER_MAX_NOTES_COUNT单次采集的帖子数量上限15CRAWLER_MAX_SLEEP_SEC每次请求之间的休眠秒数2采集类型由CRAWLER_TYPE或命令行的--type决定三种模式分工如下模式命令参数拿到的内容额外要填的配置关键词搜索--type search命中关键词的帖子及评论KEYWORDS指定帖子--type detail指定帖子的详情及评论各平台配置中的帖子 ID 列表如XHS_SPECIFIED_ID_LIST创作者主页--type creator该创作者的公开内容与评论各平台配置中的创作者 ID存储格式用--save_data_option切换支持 jsonl、csv、json、excel、sqlite、mysql、postgres建议数据量上来后存数据库以获得去重能力详见 数据存储指南。不想敲命令的话可以启动 webui/ 可视化界面两个终端分别跑uv run uvicorn api.main:app --port 8080 --reload和npm run dev在浏览器里配置参数、看实时日志、预览导出。 代理池搭建长期采集的保命步骤短频快的小任务用自己的 IP 就够了但连续跑几小时、或账号价值较高时建议启用代理。项目内置的代理池支持快代理、豌豆 HTTP 两类服务商也支持填自己的静态代理地址实现代码在 proxy/ 目录。启用只需把ENABLE_IP_PROXY改为True并在IP_PROXY_PROVIDER_NAME选择服务商、按各自后台开通提取接口流程细节见 代理使用文档。![MediaCrawler 代理IP池工作流程示意](https://raw.gitcode.com/GitHub_Trending/me/MediaCrawler/raw/5665a271ef15e0ec82b1f48a951b66760e054db9/docs/static/images/代理IP 流程图.drawio.png?utm_sourcegitcode_repo_files)如上图启动时会从服务商拉取 IP、存入 Redis 并建池请求失败时自动换下一个可用 IP。选型上的经验低频试用选免费额度即可长期项目选独享或隧道类产品避免与其他用户共享 IP 被连带封禁。 场景串联从关键词监控到评论词云以跟踪某产品口碑为例把KEYWORDS设为产品名打开ENABLE_GET_COMMENTS和ENABLE_GET_SUB_COMMENTS抓全一级与二级评论数据落库后用 Excel 导出多工作表、带格式做情感归类。如果你只想快速看讨论集中在哪把ENABLE_GET_WORDCLOUD设为True项目会直接生成评论词云图自定义词组写进CUSTOM_WORDS停用词维护在docs/hit_stopwords.txt配置方法见 词云图使用配置。 排错速查四个高频故障现象先查哪里抖音/知乎报execjs缺少;没装 Node.js 或版本低于 16小红书扫码后一直卡滑块没连真实浏览器删除项目根目录brower_data缓存后重新登录playwright 30 秒超时本机网络或代理问题检查外网连通性提示连不上 9222 端口Chrome 未运行、远程调试未勾选、或版本低于 144之前能跑现在失效账号触发风控调低频率或删除brower_data换账号重新登录更多问题在 常见问题文档 里有逐条解答。维护上注意两点Chrome 保持最新版登录态过期时优先用 CDP 复用已有登录而不是反复重登。⚖️ 合规边界与维护建议先说清楚边界项目许可为非商业学习用途采集仅限公开信息且应遵守目标平台的服务条款与 robots 协议。控制请求节奏时不要无脑调低CRAWLER_MAX_SLEEP_SEC——默认 2 秒、并发 1 已经是保守设置再激进就容易触发风控得不偿失。处理数据时注意隐私评论里可能出现他人手机号、住址等信息落库和分享前做脱敏数据仅用于分析而非二次分发。资源入口项目仓库git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler数据存储指南7 种存储格式的使用示例常见问题报错与故障逐条解答代理使用文档各服务商的开通与配置步骤【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门