EF

大数据开发
中软信息系统工程有限公司 · 6年经验
EF
日薪: ¥800/8h
地点: 北京 海淀
时间: 下班后周六周日可工作日远程
有团队 · 可整包 ID:255854 复制

0
接单数
0
评价数
1
收藏数

AI 技能提取 | Spring Boot Spring Cloud MyBatis Java Kafka Elasticsearch Solr Redis MongoDB Spark Flink HBase Hive 机器学习 Docker
熟练使用Java、Scala
能快速搭建并使用CDH组件管理平台
熟练使用Hive、Spark、SparkStreaming、Flink处理数据
熟练使用HBase、MongoDB、Solr、Elasticsearch、Redis、OTS、OSS等数据存储工具
熟练使用Kafka、DataX、Sqoop、Flume等工具
熟练使用Ansj、Hanlp、Jieba等分词工具做自定义分词
熟练使用Oozie任务调度工具
熟练使用Java常用开发框架 SpringBoot、SpringCloud、MyBatis等。
熟练使用机器学习算法,如KMeans、二分KMeans、DBScan、均值漂移聚类、正态分布、决策树、KNN、贝叶斯、协同过滤、SVD隐语义模型等
熟练使用Docker
熟练使用Git、SVN代码版本管理工具
熟练掌握Linux常用命令

项目名称:数据治理平台
使用技术:
SpringBoot+DM+Hive+HBase+DataX+Oozie
责任描述:
数据质量模块设计与研发
技术方案确定、任务排期、开发进度把控
基于数据的一致性、正确性、及时性、重复性、完整性、唯一性制定12个质量校验规则,对数据的质量进行校验并生成质检报告。
规则包括:离群值检查(拉依达法、格鲁布斯法)、空值检查、值域检查、规范检查、重复性检查、波动检查、数据集检查、记录缺失检查、引用完整性检查、及时性检查、逻辑检查、平衡性检查。
元数据模块设计与研发
技术方案确定、任务排期、开发进度把控
根据用户指定数据源连接信息采集相关元数据信息、维护各类型元数据包含、依赖关系
基于元数据做影响分析、血缘分析、全链分析、关联度分析、属性差异值分析等
指定检核规则校验元数据准确性,包括:一致性检核、依赖关系缺失检核、属性填充率检核等。
项目简介:
数据治理平台通过对数据从创建到消亡的全过程的监控和治理,实现数据的统一管理,为企业保证了业务数据在采集、集中、转换、存储、应用整个过程中的完整性、准确性、一致性和时效性,从而帮助客户建立起符合自身特征的数据架构和数据治理体系。


项目名称:投融资产品
使用技术:
HBase+Solr+Oozie+Flume+Kafka+SparkStreaming+Sqoop+DataX+Hive
责任描述:
流数据处理(SparkStreaming)
爬虫爬取A股、新三板、港股、美股的上市企业状态及财务数据,写入Kafka,使用SparkStreaming进行数据处理,处理后将结果数据推入业务系统进行使用
离线数据处理(Hive)
爬虫爬取基协、天眼查品牌、标签、报告等数据,爬取完成后,sqoop抽取增量数据至hive表,进行离线清洗,清洗后,将结果数据推入业务系统进行使用。
实时推荐(SparkStreaming)
基于用户实时行为数据计算用户偏好标签,根据标签推荐同类型企业。
服务开发
分词服务(Hanlp、Jieba+Flask)、工商信息查询服务(Jfinal)
项目简介:
提供全面实时的信息聚合看板,包含每日股权事件规模统计、行业融资趋势、机构投资排名、股权事件动态、新闻情报等内容,全面了解公司在各维度的表现,包括高管信息、股本结构、工商变更、经营异常、专利信息、上市企业财务,及时掌握融资、并购、退出、IPO的股权交易详细数据,包括参与方、金额、股权变化、关联事件等,了解机构的投资策略与基金管理情况,LP的基金投资与资金承诺情况,以及基金的募集与投资情况。了解各行业的深度研究、行业策略、行业调研、行业点评、行业资讯等内容。深入了解企业高管与投资人的职业经历、教育背景、参与股权事件情况等。

整包服务: PC网站开发UI设计其他开发
负责人: 大数据开发
团队成员: UI设计师 前端工程师 后端工程师 
EF ID:255854 复制

EF

有团队 · 可整包
大数据开发 · 6年经验 · 中软信息系统工程有限公司
城市北京 海淀 日薪800元/8h 时间 下班后周六周日可工作日远程
0
累计接单
0
用户评价
1
被收藏

信用行为

0
接单数
0
评价数
1
收藏数

技术能力

AI 技能提取 | Spring Boot Spring Cloud MyBatis Java Kafka Elasticsearch Solr Redis MongoDB Spark Flink HBase Hive 机器学习 Docker
熟练使用Java、Scala
能快速搭建并使用CDH组件管理平台
熟练使用Hive、Spark、SparkStreaming、Flink处理数据
熟练使用HBase、MongoDB、Solr、Elasticsearch、Redis、OTS、OSS等数据存储工具
熟练使用Kafka、DataX、Sqoop、Flume等工具
熟练使用Ansj、Hanlp、Jieba等分词工具做自定义分词
熟练使用Oozie任务调度工具
熟练使用Java常用开发框架 SpringBoot、SpringCloud、MyBatis等。
熟练使用机器学习算法,如KMeans、二分KMeans、DBScan、均值漂移聚类、正态分布、决策树、KNN、贝叶斯、协同过滤、SVD隐语义模型等
熟练使用Docker
熟练使用Git、SVN代码版本管理工具
熟练掌握Linux常用命令

项目经验

项目名称:数据治理平台
使用技术:
SpringBoot+DM+Hive+HBase+DataX+Oozie
责任描述:
数据质量模块设计与研发
技术方案确定、任务排期、开发进度把控
基于数据的一致性、正确性、及时性、重复性、完整性、唯一性制定12个质量校验规则,对数据的质量进行校验并生成质检报告。
规则包括:离群值检查(拉依达法、格鲁布斯法)、空值检查、值域检查、规范检查、重复性检查、波动检查、数据集检查、记录缺失检查、引用完整性检查、及时性检查、逻辑检查、平衡性检查。
元数据模块设计与研发
技术方案确定、任务排期、开发进度把控
根据用户指定数据源连接信息采集相关元数据信息、维护各类型元数据包含、依赖关系
基于元数据做影响分析、血缘分析、全链分析、关联度分析、属性差异值分析等
指定检核规则校验元数据准确性,包括:一致性检核、依赖关系缺失检核、属性填充率检核等。
项目简介:
数据治理平台通过对数据从创建到消亡的全过程的监控和治理,实现数据的统一管理,为企业保证了业务数据在采集、集中、转换、存储、应用整个过程中的完整性、准确性、一致性和时效性,从而帮助客户建立起符合自身特征的数据架构和数据治理体系。


项目名称:投融资产品
使用技术:
HBase+Solr+Oozie+Flume+Kafka+SparkStreaming+Sqoop+DataX+Hive
责任描述:
流数据处理(SparkStreaming)
爬虫爬取A股、新三板、港股、美股的上市企业状态及财务数据,写入Kafka,使用SparkStreaming进行数据处理,处理后将结果数据推入业务系统进行使用
离线数据处理(Hive)
爬虫爬取基协、天眼查品牌、标签、报告等数据,爬取完成后,sqoop抽取增量数据至hive表,进行离线清洗,清洗后,将结果数据推入业务系统进行使用。
实时推荐(SparkStreaming)
基于用户实时行为数据计算用户偏好标签,根据标签推荐同类型企业。
服务开发
分词服务(Hanlp、Jieba+Flask)、工商信息查询服务(Jfinal)
项目简介:
提供全面实时的信息聚合看板,包含每日股权事件规模统计、行业融资趋势、机构投资排名、股权事件动态、新闻情报等内容,全面了解公司在各维度的表现,包括高管信息、股本结构、工商变更、经营异常、专利信息、上市企业财务,及时掌握融资、并购、退出、IPO的股权交易详细数据,包括参与方、金额、股权变化、关联事件等,了解机构的投资策略与基金管理情况,LP的基金投资与资金承诺情况,以及基金的募集与投资情况。了解各行业的深度研究、行业策略、行业调研、行业点评、行业资讯等内容。深入了解企业高管与投资人的职业经历、教育背景、参与股权事件情况等。

团队情况

服务范围:
PC网站开发UI设计其他开发
团队构成:
负责人(大数据开发) | 核心队员:UI设计师 · 前端工程师 · 后端工程师
客服二维码

没找到合适的人才?

扫码添加客服极速匹配,或直接发布需求让更多人才主动报名

平台担保交易 · 1小时内不满意可退款

平台信誉与实力

基于 35,336 需求方信任

  • 支付宝企业信用分 优秀 评级
  • 市场份额约占全行业三分之一
  • 程序员兼职行业全能首选平台
查看平台资质详情
收藏