电子元器件和新闻爬虫系统
基于 Scrapy 爬虫对电子元器件的详细信息的抓取以及各大新闻网站的新闻信息的
抓取,通过对目标网站的分析,使用内置 Xpath、Css 对网页内容结构化的提取,其中也
包括对从动态网页的的分析,对网页中特殊字段使用了正则表达式进行采集,在数据清
洗的过程中也使用了正则表达式和一些字符串内置函数对数据进行处理,存入数据库中,
其中使用了自己自建的 IP 代理池,大部分都是从网上抓取过来的,但是,不是很稳定。
垂直搜索引擎系统(Django+Elasticsearch+Scrapy-Redis)
基于 Django 的垂直搜索引擎,利用 Scrapy 结合 Redis 实现分布式的数据抓取,抓
取了部分网站的数据,上传至 Elasticsearch,利用 Elasticsearch 搜索服务器搭建了
一个搜索引擎,主要通过 Django 与 Elasticsearch 交互,完成搜索功能,使用 Nginx
进行项目的部署。
豆瓣推广系统
主要调用了 Selenium 接口控制浏览器模拟人为操作。在豆瓣的各个小组内推广自己
的产品,其中包括豆瓣账号注册模块,手机号由第三方提供,使用云打码来破解验证码,
一个 IP 对应一个账号来防止被封;小组添加模块,每个账号可以指定添加任意一个或多
个小组;小组发帖模块,在自己所添加的小组,进行指定内容的发帖;小组顶贴模块,
在小组内,对指定标题进行顶贴,从而达到推广自己的产品。