熟练使用Python开展网络爬虫、数据分析与自动化脚本编写。精通Requests、DrissionPage、Selenium实现静态与动态网页数据采集,掌握XPath、正则表达式进行页面信息解析;熟练运用Pandas、NumPy完成数据清洗、整理、统计分析。能够独立编写自动化办公脚本,实现文件批量处理、信息自动抓取、重复工作自动化。了解反爬基础策略,可设置请求间隔、请求头应对基础网站限制;具备结构化数据导出能力,可将采集数据保存为Excel格式,排查爬虫运行异常,保障程序稳定持续运行。
网页数据采集项目:基于DrissionPage开发爬虫程序,自动化抓取网页公开信息,处理动态加载页面,清洗无效脏数据,批量导出结构化表格,替代人工复制录入,大幅提升信息收集效率。Python自动化办公项目:编写自动化脚本,实现本地文件批量归类、表格数据自动汇总比对,自动完成重复性数据录入工作。数据分析处理项目:使用Pandas对大量原始数据集进行筛选、去重、统计运算,整理出可供直接使用的规整数据,支撑信息汇总与内容调研工作。