项目一:烟草生物活性成分资源库查询系统开发
项目周期:2024.01 - 2025.12 | 岗位:项目负责人
项目简介
针对烟草生物活性成分数据分散、获取效率低的行业痛点,搭建一站式资源库查询系统,整合多渠道烟草成分数据,实现结构化/非结构化数据统一高效检索与全生命周期管理,为烟草科研研发提供数据支撑。
技术栈:Python、Scrapy、Requests、Selenium、XPath、BeautifulSoup、Pytesseract(OCR)、Pandas、Numpy、MySQL、Elasticsearch、Node.js、JavaScript、Axios、RESTful API
工作职责
1. 开展业务调研,对接烟草科研人员明确功能、数据需求与使用场景,输出整体开发方案;梳理10+国内外官方、学术数据源,搭建标准化数据采集清单。
2. 分场景开发爬虫采集体系:静态页面采用Python+Requests/Scrapy批量爬取,通过XPath、BeautifulSoup完成数据解析;动态渲染、需登录交互页面使用Selenium模拟浏览器操作,解决JS渲染、反爬拦截带来的数据采集难题。
3. 搭建数据清洗与标准化流程:利用Pandas、Numpy清洗网页半结构化数据,统一处理缺失、异常、重复数据;基于Python+Pytesseract OCR解析PDF文献,提取化合物、CAS号等关键信息,转换为标准结构化表格。
4. 设计分层存储检索架构:MySQL存储基础业务单表,Elasticsearch搭建全文检索引擎,定制索引结构、分词与倒排策略,实现百万级文献数据高速检索。
5. 全栈前后端开发:后端基于Node.js搭建RESTful API,使用elasticsearch.js客户端开发多条件精准检索、模糊查询、分页、排序能力;前端采用JavaScript+Axios对接接口,实现查询实时校验、数据懒加载、分页联动交互。
6. 系统性能优化,针对海量数据查询场景专项调优,保障平台响应速度与高并发稳定性。
工作业绩
7. 累计采集、清洗、标准化烟草成分数据4500+条,搭建百万级参考文献标准化资源库;
8. 落地一套可复用的「数据采集-清洗-入库」标准化流程,可供同类数据平台复用;
9. 系统上线落地,大幅减少科研人员人工检索工作量,获得合作方高度认可。