2018.08-至今 票据云服务平台
开发环境: IDEA、JDK1.8、Oracle11、Apache-Tomcat8、Nginx、GitLab、Nexus、redis、elasticsearch、hbase、fastdfs、Linux、Maven
软件架构: SpringMVC + Spring Boot + Mybaits/Mybatis-plus + dubbo + elastic-job + elasticsearch-rest + phoenix + itext-7 + ofdrw + vue
系统描述: 该系统主要分为 核心服务,数据仓库,运营中心,应用中心,电子票夹,电票云管家小程序,微信公众号,支付宝公众号。整体采用前后端项目分离,后台使用分布式框架组件进行开发;
核心业务为:为开票单位做票据通知的服务,实现票据找人的效果。为开票单位的个人用户,商保和医保授权用户提供票据的查询,下载等服务。
其中电子票夹统从18年10月上线后,至今已拥有2.26kw的注册用户,为全国上万家开票单位进行通知服务,日通知量为千万级别,拥有26亿存量票据。
2017.03-2018.07 知闻大数据平台 V2
开发环境 : Eclipse、JDK1.8、MySQL5.5、Apache-Tomcat8、Maven、Nginx、Redis
软件架构: SpringMVC + Spring + Mybaits + Spring-data-elasticsearch + Nginx + Activiti5
+ cxf-WebService + stuts2 + jedis + Spring-Kafka
系统描述: 该系统主要分为 爬虫系统 , 爬虫后台管理系统 , 入库流程 , 推送系统 , 后台管理系统 , 知闻数据平台 和 知闻 API 系统。
该平台为云Paas 平台的一个子项目,主要面向广大媒体人提供数据素材。该平台核心流程为:实时检测源网站动态,汇聚来自全国各行业数千个网站源的数据, 经过流程化数据清洗,进行分类入库,为广大媒体人提供数据服务(检索,热点汇聚,舆情预警等)的平台。
技术描述 : 1. 爬虫系统分为,微信(weixinCrawler),微博(weiboCrawler)和网页爬虫, 主要采用htmlUnit 和jsoup 开启多线程去爬取 清洗数据.