首页 AI副业工具 MediaCrawler 实战:把小红书抖音评论变成 AI 训练语料

MediaCrawler 实战:把小红书抖音评论变成 AI 训练语料

📅 2026/8/8 👁 阅读 4 🔗 工具访问 0 次 📂 AI副业工具
MediaCrawler 实战:把小红书抖音评论变成 AI 训练语料

工具地址

https://github.com/NanmiCoder/MediaCrawler

🚀 访问工具

做 RAG 的朋友都懂一个痛:模型好找,语料难搞。想给知识库塞点小红书笔记、抖音评论区的高质量中文内容,官方 API 要么没有、要么贵的离谱,手动复制粘贴又纯属自虐。

MediaCrawler 就是为这个场景生的。这个 60K+ Star 的开源项目,把小红书、抖音、快手、B站、微博、贴吧、知乎 7 个平台的公开数据采集做成了开箱即用的流水线,而且全程不用碰 JS 逆向。上一篇我们聊过它怎么装怎么跑,这篇换个角度:怎么拿它搭一条真正能用的 AI 数据管线。

MediaCrawler AI 数据采集工作流封面图

先想清楚:你爬数据到底要干嘛

用之前先分清楚场景,这决定你后面每一步怎么走:

做 RAG 知识库。 想要某个领域的真实用户表达,比如母婴、健身、美妆,评论区和笔记是最鲜活的语料,比网上的二手文章真实得多。

做模型微调。 需要大量带互动数据的真实内容,采集后做清洗和标注,就是现成的 SFT 数据集。

做舆情和竞品分析。 不需要喂给模型,要的是 Excel 表格和词云图,给老板看的那种。

三种场景,MediaCrawler 全都能接,差别只在最后的输出格式。

一条命令,数据从平台落到本地

环境装好之后,采集本身简单得不像话:

uv run main.py --platform xhs --lt qrcode --type search

手机扫码登录,程序就用你浏览器里的登录态开爬。关键词、帖子 ID、创作者主页三种方式随便选,评论默认抓二级,够用了。

有个细节很值钱:CDP 模式连的是你本机 Chrome,登录态和 Cookie 都是现成的,风控识别率比自写请求头低一大截。我跑小红书连爬几百条笔记没被拦过,换以前自己写脚本早被封号了。

落库选 MySQL,给 AI 留好接口

采集结果支持 CSV、JSON、JSONL、Excel、SQLite、MySQL 六种格式。做 AI 数据管线,我强烈建议直接落 MySQL:

第一,数据量大不卡。几万条评论写 CSV 打开就卡死,MySQL 随便查。第二,后面接清洗脚本方便,一条 SQL 就能按关键词、时间、点赞数筛数据。第三,RAG 工具链(比如 Dify、FastGPT 这类)直接连 MySQL 建知识库,中间不用倒腾文件格式。

落库的时候建议把评论和笔记分表存,互动数据(点赞、评论数)单独建索引,清洗阶段会省很多事。

清洗这一步,决定语料质量

爬下来的数据不能直接用。我踩过的坑列几个:

去重。 同一篇笔记会被多个关键词搜到,按笔记 ID 去重是必须的。

过滤短评。 "哈哈哈""沙发"这类无意义评论,按长度阈值一筛就没了。

清洗 emoji 和脏数据。 emoji 对训练影响看场景,但至少要统一处理,不然分词都乱。

这几步用 Pandas 写个几十行的清洗脚本就能搞定,筛完的数据直接导出 JSONL,就是标准的训练语料格式。

不想写代码?WebUI 和 Agent 都安排上了

项目内置 WebUI 图形界面,平台、登录方式、爬取类型全在网页上点选,实时看日志,还能预览导出数据。非程序员做选品分析、舆情监控,用这个就够了。

玩 AI Agent 的话还有惊喜:官方 Pro 版本支持 AI Agent Skill,OpenClaw、Claude Code、Cursor 一键安装,让 Agent 自动去爬数据。开源版虽然没有,但作者在 README 里画了饼——基于评论分析的 AI Agent 正在开发中。这条生态路线,爬虫工具里很少见。

几个提醒,别踩红线

这个项目 README 开头就是大段免责声明:仅供学习研究,禁止商业用途。国内爬虫违法案例真不少,采集个人信息、大规模商用抓取都有法律风险,想商用要么自己评估合规,要么去看官方 Pro 版的授权方式。

另外各平台风控一直在升级,账号被限流甚至封禁的风险是真实的。代理池能缓解,但别把生产环境的命脉压在一个免费开源工具上。

总结一句

MediaCrawler 的价值不只是"能爬",而是把从采集到落库的整条数据管线给你铺好了。对做 AI 应用的人来说,它就是那个把语料问题从"不可能"变成"一下午搞定"的工具。数据合规自己把关,工具本身是真的能打。

GitHub:https://github.com/NanmiCoder/MediaCrawler
官方文档:https://nanmicoder.github.io/MediaCrawler/

📎 相关阅读:MediaCrawler:多平台自媒体数据采集利器(入门篇)

标签:#MediaCrawler #爬虫 #数据采集 #AI训练数据 #RAG #语料 #小红书 #抖音 #开源工具


关注我,每期分享一个帮你省事的强大工具 🛠️

💬 评论区 (0 条评论)

暂无评论,快来发表第一条评论吧!

📤 分享这篇文章

📌 相关推荐

微信扫码分享

打开微信扫一扫