一、18年世界杯爬虫。
爬取世界杯比赛期间比赛的实时相关数据(当时的数据比视频信号快接近10秒),并通过公众号对订阅用户进行推送。
分组的各个球队的信息,包括榜单,积分,球员资料等。
世界杯新闻聚合,涉及的网站有FIFA官网、腾讯体育、新浪体育、虎扑、ESpn、部分世界杯参赛球员的推特内容。
部分世界杯视频集锦。
二、中国工商局商标网商标信息的爬取
语言: Python3.6
技术选型: scrapy + mongodb
成果: 破解了商标网url加密,人机识别, IP的封禁反爬虫机制。抓取了大量商标信息并储存入库。
三、章鱼直播比分模块开发。
项目描述:为用户提供全球2193家足球赛事的比赛数据信息。包括多赛季赛程,赛果,实时比分、角球,红黄牌、控球率、进攻次数、危险进攻次数,文字直播的push,并支持动画直播。全球20+公司的实时赔率数据与多种不同玩法的数据展示。
我的职责:负责整个比分的数据结构设计,爬虫架构。赛程, 多赛季历史数据赛,实时比分push, 北单竞彩等多家彩票赔率, 20+公司的赔率数据, 文字直播, 动画直播的爬虫开发(scrapy, scrapy-redis),部署(jenkins+scrapyd)和维护。