小红书笔记帖子信息采集模块
针对小红书平台内容生态,开发了一套基于帖子分享链接的笔记信息采集功能。系统支持输入单篇或多篇笔记的分享 URL,自动解析短链重定向获取笔记唯一 ID(note_id),进而通过 Web 端接口或浏览器渲染方式拉取笔记详情页全量数据。
在字段提取层面,可结构化获取笔记标题、正文文案、话题标签(hashtag)、图片/视频素材链接列表、发布者昵称与用户 ID、发布时间、点赞数、收藏数、评论数、分享数、IP 属地等公开字段。图文笔记与视频笔记均可适配解析,确保内容类型全覆盖。
工程实现上,采用 Python + Playwright 处理页面动态渲染,模拟真实用户浏览行为以绕过平台的反自动化检测;结合 Requests 直接调用接口时,通过维护有效 Cookie 池、动态生成签名请求头、随机化请求间隔与 User-Agent 等方式应对反爬策略。采集结果经去重与异常过滤后,统一写入 MongoDB 与 MySQL 双库存储,图片资源同步下载归档。