Nick Hui

高级数据开发工程师
cognizant · 6年经验
Nick Hui
日薪: ¥1000/8h
地点: 上海 浦东
时间: 可工作日远程可工作日驻场(自由职业原因)
ID:345569 复制

0
接单数
0
评价数
1
收藏数

AI 技能提取 | Python Vue React JavaScript Java MySQL Redis Oracle PostgreSQL HBase Hive HTML CSS jQuery Hadoop
1.熟练掌握 python3 编程,会java、shell、scala语言
2.熟悉 aws 服务,hadoop生态
3.采集方面,掌握python的爬虫框架scrapy
4.数据处理 ,掌握数据清洗etl相关技能,kettle,airflow, pyspark
5.数据存储 ,熟练mysql,熟悉hive,hbase,oracle,sqlserver,redis,mongdb,postgresql等数据库
6.python框架,擅长django,熟悉flask、fastapi框架
7.web前端:能熟练使用html、css、javascript语言,掌握jquery、vue、react框架
8.部署:熟悉linux,docker管理, jekins , aws

数据迁移项目 .
背景:主数据来自诺华公司concur报销数据,eapproval数据等,最终生成7 张报 告,原系统用的sqlserver的存储过程生成报告,繁琐而复杂,公司不用原系统了,决定走spark服务,
开发过程:
1、 建立数据模型,生成sttm报告
2、 根据数据模型将数据分层,大的层级有3层
第一层:raw层,主要将原始文件数据接进来,根据业务情况分增量数据和全量数据,又分了三层,pre_landing层(对原始文件进行处理成统一csv文件并备份),landing层(将csv文件写入redshift库),landing_merge层(对增量数据做处理).
第二层:unified 层,将raw层的各个表数据进行清洗,并做逻辑关联处理,落地到redshift库中(底层数据在s3上)
第三层:publish层,将unified层数据做逻辑处理落地到postgresql数据库中,再读取各个表数据生成7张报告推送到publish层的s3上
3、 开发并部署,主要使用的pyspark做开发,用jekins做部署,用airflow 做调度,生成的gluejob运行在aws的云服务上
Nick Hui ID:345569 复制

Nick Hui

高级数据开发工程师 · 6年经验 · cognizant
城市上海 浦东 日薪1000元/8h 时间 可工作日远程可工作日驻场(自由职业原因)
0
累计接单
0
用户评价
1
被收藏

信用行为

0
接单数
0
评价数
1
收藏数

技术能力

AI 技能提取 | Python Vue React JavaScript Java MySQL Redis Oracle PostgreSQL HBase Hive HTML CSS jQuery Hadoop
1.熟练掌握 python3 编程,会java、shell、scala语言
2.熟悉 aws 服务,hadoop生态
3.采集方面,掌握python的爬虫框架scrapy
4.数据处理 ,掌握数据清洗etl相关技能,kettle,airflow, pyspark
5.数据存储 ,熟练mysql,熟悉hive,hbase,oracle,sqlserver,redis,mongdb,postgresql等数据库
6.python框架,擅长django,熟悉flask、fastapi框架
7.web前端:能熟练使用html、css、javascript语言,掌握jquery、vue、react框架
8.部署:熟悉linux,docker管理, jekins , aws

项目经验

数据迁移项目 .
背景:主数据来自诺华公司concur报销数据,eapproval数据等,最终生成7 张报 告,原系统用的sqlserver的存储过程生成报告,繁琐而复杂,公司不用原系统了,决定走spark服务,
开发过程:
1、 建立数据模型,生成sttm报告
2、 根据数据模型将数据分层,大的层级有3层
第一层:raw层,主要将原始文件数据接进来,根据业务情况分增量数据和全量数据,又分了三层,pre_landing层(对原始文件进行处理成统一csv文件并备份),landing层(将csv文件写入redshift库),landing_merge层(对增量数据做处理).
第二层:unified 层,将raw层的各个表数据进行清洗,并做逻辑关联处理,落地到redshift库中(底层数据在s3上)
第三层:publish层,将unified层数据做逻辑处理落地到postgresql数据库中,再读取各个表数据生成7张报告推送到publish层的s3上
3、 开发并部署,主要使用的pyspark做开发,用jekins做部署,用airflow 做调度,生成的gluejob运行在aws的云服务上
客服二维码

没找到合适的人才?

扫码添加客服极速匹配,或直接发布需求让更多人才主动报名

平台担保交易 · 1小时内不满意可退款

平台信誉与实力

基于 35,336 需求方信任

  • 支付宝企业信用分 优秀 评级
  • 市场份额约占全行业三分之一
  • 程序员兼职行业全能首选平台
查看平台资质详情
收藏