项目一:某电商网站商品信息爬取
项目描述:爬取目标电商网站的商品列表及详情页数据,包括商品名称、价格、销量、评价数等字段,
用于市场竞品分析。
技术栈:requests + BeautifulSoup + pandas + time
职责与难点:
分析网站分页规律,构造循环请求实现多页数据抓取。
针对商品详情页的异步加载内容,使用Selenium模拟浏览器滚动与点击,获取完整页面源代码后再用BeautifulSoup 解析。
对缺失字段进行异常处理,使用 pandas清洗数据并导出为Excel报表。
成果:累计抓取有效数据2000余条,为客户提供了及时的价格监测依据。
项目二:某动态网站评论数据采集
项目描述:采集某个社交平台的用户评论,包含用户名、评论内容、点赞数、发布时间。
技术栈:Selenium+re+pandas
职责:
使用Selenium模拟登录和滚动加载,处理无限滚动分页。
利用正则表达式从页面源码中提取隐藏的JSON数据块,转为字典后提取字段。
将最终结果保存为CSV文件,并编写简单的统计分析
成果:完成了2000条评论的采集与初步分析,交付代码及使用说明。
以上项目均为独立完成,代码注释清晰,具备良好的可维护性。