精通 Python 开发,核心擅长网络数据爬虫项目开发。熟练运用 Requests、Playwright、BeautifulSoup、XPath 等技术,实现静态网页与动态渲染网站的数据采集;掌握异步、多线程爬虫开发,优化采集速度。可针对性解决各类网站反爬限制,支持代理池配置、访问频率控制。能够完成原始数据清洗、去重,将结构化数据存入 MySQL、MongoDB 数据库。具备代码调试、异常捕获能力,保障爬虫长期稳定运行。了解爬虫相关合规规范,可按照业务需求设计轻量化、可拓展的数据采集方案,配套完成数据预处理,支撑后续数据分析工作。
主导多个 Python 爬虫数据采集项目,熟练处理静态页面与 JS 动态渲染网站的数据获取。使用 Requests、Playwright、BeautifulSoup 构建采集程序,运用异步协程、多线程方案提升采集效率;通过代理池、访问间隔控制、请求头伪装等手段应对各类反爬策略。完成采集数据清洗、去重、格式标准化,将数据持久化至 MySQL、MongoDB 数据库;增加异常捕获、运行日志模块,提升程序鲁棒性。可根据需求定制周期性采集任务,兼顾采集效率与网站访问规范,输出高质量结构化数据集,支撑业务数据分析工作。
目标网站:天眼查 目标网址:https://www.tianyancha.com/ 任务需求:分别搜索北京半导体、上海半导体、深圳半导体、广州半导体、杭州半导体、成都半导体 这6个关键字,并使用多任务的方式分别获取40个公司的数据。 采集字段:参考下图中红色方框里的信息,若
目标网站:药物临床实验登记 目标网址:https://www.chinadrugtrials.org.cn/clinicaltrials.searchlist.dhtml 任务需求:使用selenium,采集前100页的数据信息。 采集字段:登记号、试验状态、药物名称、适应