分布式爬虫架构:主导设计基于 Scrapy 的高可用分布式爬虫集群,沉淀通用中间件(UA 池/代理池/Cookie 池/布隆去
重)+Pipeline 模块化体系,实现多项目(海外商品、旅游 POI、小红书等)模块复用,让多项目并行开发效率直接拉升 40%,数
据采集成功率稳定在 98%以上。
反爬破解与逆向:系统性突破各类反爬机制(字符/滑块验证码、携程 token、小红书 x-s、马蜂窝 wtsfp、Cloudflare
5s 盾),熟练运用补环境、算法还原、TLS 指纹模拟等手段,保障核心采集任务长期稳定运行。
自动化与平台工程:Docker 化部署 Crawlab 爬虫管理平台及 Firecrawl 通用采集框架;基于 DrissionPage 构建跨平
台(头条/知乎/公众号/小红书)内容自动化发布系统,把运营团队从重复劳动中彻底解放,运营效率显著提升。
后端服务与数据处理:开发企业微信机器人多租户管理服务(Flask+多进程/线程),实现消息智能分发;基于 FastMcp
开发 MCP 服务并接入 Dify 平台;利用 Superset 搭建业务数据看板,Pandas 完成 ETL 与数据清洗,为 Al 模型及业务决
策提供高质量数据支持。