熟练掌握 Python 编程语言,具备扎实的爬虫开发与数据处理能力,熟练使用 Requests、BeautifulSoup 解析网页结构,能够完成静态网页数据抓取、多页翻页爬取、分类数据采集、内容清洗与结构化整理。熟练运用 JSON 进行数据持久化导出,掌握列表推导式、字典去重、Counter 统计、lambda 排序等常用数据处理技术。能够处理网页标签解析、文本清洗、空值过滤、异常重试机制,有效解决爬虫超时、页面结构变动、数据重复等常见问题。具备良好的代码规范、异常捕获机制与爬虫防封禁意识,能够独立完成中小型数据采集、清洗、分类统计、结构化导出全套开发工作。
独立完成多套网站数据爬虫项目,包括书籍分类爬虫、名言全站爬虫、多页面批量采集项目。能够自动抓取网站分类目录、遍历多分页数据,提取书名、价格、星级评分、库存、分类、标签等多维度字段,通过字典唯一键完成数据自动去重,保证数据纯净无重复。对爬取内容进行文本清洗、格式统一、星级数字映射排序,最终将结构化数据导出为标准 JSON 文件。项目完整实现自动翻页、失败重试、数据统计、分类数量汇总、数据排序与规范化存储,熟练解决网页解析错位、空数据、标签匹配失败等问题,具备完整独立的数据采集项目开发能力。