采集任务的分析,并负责采集方案设计; 分析页面结构使用正则表达式、xpath、css选择器等方式采集确保数据不遗漏; 采用scrapy框架实现爬虫方案,并重写start_requests,对部分静态数据采用正则提取,使用redis对新增url资源去重以提高效率; 编写pip
案例内容包含京东、阿里、药师帮等网站内容关于药品部分的数据爬虫; 案例以多线程实现数据采集,mongo数据库去重,最终数据进入hbase库中 其中药师帮等网站实现js逆向获取密码加密方式,另外配置有单独的代理函数、日志文件处理、去重等
1、实现20+以上终端客户的药品进销存数据采集、清洗、整合、入库 2、通过配置有专门的文件,可实现批量终端客户添加,仅需添加终端客户名称、账户密码、采集进销存数据类型即可实现该终端历史数据(以终端支持的回溯时间为准)入库 3、数据整合后进入CDH平台下hive数据库,支持后续
鼠标悬停或点击上方资质图片,可放大右下角二维码进行扫码验真。
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如该工程师当前档期不合,也可免费为您推荐相似候选人