| 采集维度 | 采集内容 | 典型场景 | 推荐工具 |
|---|---|---|---|
| 关键词搜索结果采集 | 搜索某个关键词后出现的所有笔记标题、互动数据 | 品类趋势分析、竞品内容监控 | MediaClaw / 后裔采集器 |
| 笔记详情页采集 | 单篇笔记的完整正文、图片、评论内容 | 内容拆解、舆情分析、用户反馈收集 | XHS-Downloader / Python脚本 |
| 博主主页采集 | 某个博主发布的所有笔记列表和互动数据 | 竞品博主分析、达人筛选、内容策略研究 | XHS-Downloader / 后裔采集器 |
一、浏览器插件方案:不需要装软件,打开小红书网页就能采集
MediaClaw社媒虾:专为小红书设计的免费采集插件
MediaClaw是一款免费的Chrome浏览器插件,专门针对小红书等国内社交媒体平台设计。安装后在小红书网页版搜索任意关键词,插件会在页面右下角显示一个采集面板,点击开始采集后自动滚动翻页,逐条提取搜索结果中的笔记标题、正文摘要、点赞数、收藏数、评论数、发布时间和博主昵称。采集完成后一键导出为CSV或Excel格式。
浏览器插件的天然短板
所有浏览器插件采集方案的共同问题是:采集过程中浏览器不能关、电脑不能休眠,采集速度受限于页面加载速度。而且小红书对浏览器端的请求频率有严格限制——翻页太快会被弹出验证码,翻页太慢采集几百条数据要跑十几分钟。如果你需要采集的数据量在千条以上,浏览器插件方案就不太现实了,得上客户端或脚本方案。
二、可视化客户端方案:不懂代码也能配置复杂的采集规则
后裔采集器:网页上点哪里就采集哪里,翻页和登录都能自动处理
后裔采集器是国产的可视化网页采集工具,免费版功能完整。它的操作逻辑是"所见即所得"——打开小红书网页版,用鼠标点击你要采集的字段(比如点击第一条笔记的标题),后裔会自动识别页面上所有相同结构的标题位置,批量提取。不需要写XPath或CSS选择器。
后裔采集器采集小红书最容易被封的两种操作
1. 翻页间隔太短:新手最容易犯的错。小红书的反爬机制对滚动速度极其敏感,设置0秒间隔连续翻页等于告诉平台"这是个机器人在爬数据"。建议翻页间隔至少3秒,如果能接受更慢的速度,5-8秒更安全。2. 不处理验证码:采集过程中如果弹出滑块验证码,后裔采集器默认不会自动处理,采集会卡住。需要手动完成验证后再继续。如果频繁弹出验证码,说明采集频率太高了,先停一段时间再继续。
三、开源脚本方案:灵活性最高,但需要一点Python基础
XHS-Downloader:GitHub上Star最多的中文小红书采集开源项目
XHS-Downloader是一个基于Python的开源项目,专门用于下载小红书笔记的图文和视频内容。它的核心能力是:输入一个关键词或博主主页链接,自动采集笔记的完整正文、无水印图片、视频文件,保存为本地Markdown文件(图片嵌入在Markdown里)。相比浏览器插件和客户端工具,它的最大优势是可以批量处理、可以24小时挂着跑、采集速度不受浏览器限制。
开源方案的两个实际障碍
第一,小红书的反爬机制持续更新,开源项目可能跟不上。如果小红书改了接口加密方式或增加了新的验证机制,脚本可能突然不能用了,需要等项目维护者更新代码。第二,Cookie管理是个麻烦事。Cookie过期后采集会中断,如果设置了每天自动运行的任务,某天Cookie过期了没发现,采集就白跑了。长期依赖开源脚本做采集的话,建议加一个Cookie过期检测和自动提醒的逻辑。
四、Python自建脚本:如果你会写代码,这是最可控的方案
用DrissionPage模拟浏览器操作,比Selenium更轻量
如果你有Python基础,用DrissionPage库写一个自己的小红书采集脚本是最灵活的选择。DrissionPage是一个国产的浏览器自动化库,比Selenium更轻量、不需要下载浏览器驱动、直接操控Chromium内核。核心逻辑是:打开小红书搜索页→模拟滚动翻页→解析页面元素提取标题、正文、互动数据→保存到CSV。
五、不同场景选哪款工具
场景一:运营人员日常竞品分析,采集几百条笔记做标题和内容拆解
用MediaClaw浏览器插件。免费、不用装软件、打开网页就能采集、导出CSV直接分析。几百条的数据量浏览器插件完全能应付。
场景二:不懂代码但需要采集几千条数据,还要定时自动跑
用后裔采集器免费版。可视化配置翻页规则和字段映射,支持二级详情页采集和定时任务。虽然配置比浏览器插件复杂一些,但学会了之后灵活度提升一大截。

场景三:需要下载无水印笔记图文、批量采集博主主页内容
用XHS-Downloader开源脚本。免费、功能强大、支持无水印下载。有Python基础的话自己部署,没有基础的话按项目文档操作也能跑起来。

场景四:大规模持续性采集,需要完全可控的方案
用Python自建脚本(DrissionPage)。灵活性最高,但需要编程能力和持续维护。适合有技术团队的公司,不适合个人运营者。
采集工具只是手段,最终要回答的是"你采集这些数据想干什么"。拿竞品爆款笔记数据来拆解标题公式、正文结构、配图规律,然后用到自己的内容创作里——这比单纯看数据报告有用得多。反过来,如果采集了几万条数据只是存着没分析,等于白费功夫。动手之前先想清楚你需要的分析维度——标题关键词频次?发布时间与互动量的关系?正文长度与收藏数的相关性?想清楚了再决定采集哪些字段、用什么工具,避免采了一堆用不上的数据。

