做 RAG 的朋友都懂一个痛:模型好找,语料难搞。想给知识库塞点小红书笔记、抖音评论区的高质量中文内容,官方 API 要么没有、要么贵的离谱,手动复制粘贴又纯属自虐。
MediaCrawler 就是为这个场景生的。这个 60K+ Star 的开源项目,把小红书、抖音、快手、B站、微博、贴吧、知乎 7 个平台的公开数据采集做成了开箱即用的流水线,而且全程不用碰 JS 逆向。上一篇我们聊过它怎么装怎么跑,这篇换个角度:怎么拿它搭一条真正能用的 AI 数据管线。
先想清楚:你爬数据到底要干嘛
用之前先分清楚场景,这决定你后面每一步怎么走:
做 RAG 知识库。 想要某个领域的真实用户表达,比如母婴、健身、美妆,评论区和笔记是最鲜活的语料,比网上的二手文章真实得多。
做模型微调。 需要大量带互动数据的真实内容,采集后做清洗和标注,就是现成的 SFT 数据集。
做舆情和竞品分析。 不需要喂给模型,要的是 Excel 表格和词云图,给老板看的那种。
三种场景,MediaCrawler 全都能接,差别只在最后的输出格式。
一条命令,数据从平台落到本地
环境装好之后,采集本身简单得不像话:
uv run main.py --platform xhs --lt qrcode --type search
手机扫码登录,程序就用你浏览器里的登录态开爬。关键词、帖子 ID、创作者主页三种方式随便选,评论默认抓二级,够用了。
有个细节很值钱:CDP 模式连的是你本机 Chrome,登录态和 Cookie 都是现成的,风控识别率比自写请求头低一大截。我跑小红书连爬几百条笔记没被拦过,换以前自己写脚本早被封号了。
落库选 MySQL,给 AI 留好接口
采集结果支持 CSV、JSON、JSONL、Excel、SQLite、MySQL 六种格式。做 AI 数据管线,我强烈建议直接落 MySQL:
第一,数据量大不卡。几万条评论写 CSV 打开就卡死,MySQL 随便查。第二,后面接清洗脚本方便,一条 SQL 就能按关键词、时间、点赞数筛数据。第三,RAG 工具链(比如 Dify、FastGPT 这类)直接连 MySQL 建知识库,中间不用倒腾文件格式。
落库的时候建议把评论和笔记分表存,互动数据(点赞、评论数)单独建索引,清洗阶段会省很多事。
清洗这一步,决定语料质量
爬下来的数据不能直接用。我踩过的坑列几个:
去重。 同一篇笔记会被多个关键词搜到,按笔记 ID 去重是必须的。
过滤短评。 "哈哈哈""沙发"这类无意义评论,按长度阈值一筛就没了。
清洗 emoji 和脏数据。 emoji 对训练影响看场景,但至少要统一处理,不然分词都乱。
这几步用 Pandas 写个几十行的清洗脚本就能搞定,筛完的数据直接导出 JSONL,就是标准的训练语料格式。
不想写代码?WebUI 和 Agent 都安排上了
项目内置 WebUI 图形界面,平台、登录方式、爬取类型全在网页上点选,实时看日志,还能预览导出数据。非程序员做选品分析、舆情监控,用这个就够了。
玩 AI Agent 的话还有惊喜:官方 Pro 版本支持 AI Agent Skill,OpenClaw、Claude Code、Cursor 一键安装,让 Agent 自动去爬数据。开源版虽然没有,但作者在 README 里画了饼——基于评论分析的 AI Agent 正在开发中。这条生态路线,爬虫工具里很少见。
几个提醒,别踩红线
这个项目 README 开头就是大段免责声明:仅供学习研究,禁止商业用途。国内爬虫违法案例真不少,采集个人信息、大规模商用抓取都有法律风险,想商用要么自己评估合规,要么去看官方 Pro 版的授权方式。
另外各平台风控一直在升级,账号被限流甚至封禁的风险是真实的。代理池能缓解,但别把生产环境的命脉压在一个免费开源工具上。
总结一句
MediaCrawler 的价值不只是"能爬",而是把从采集到落库的整条数据管线给你铺好了。对做 AI 应用的人来说,它就是那个把语料问题从"不可能"变成"一下午搞定"的工具。数据合规自己把关,工具本身是真的能打。
GitHub:https://github.com/NanmiCoder/MediaCrawler
官方文档:https://nanmicoder.github.io/MediaCrawler/
📎 相关阅读:MediaCrawler:多平台自媒体数据采集利器(入门篇)
标签:#MediaCrawler #爬虫 #数据采集 #AI训练数据 #RAG #语料 #小红书 #抖音 #开源工具
关注我,每期分享一个帮你省事的强大工具 🛠️