1.自主设计开发了mongodb_scrapy分布式爬虫框架:
区别于scrapy_redis分布式框架,当数据量达到百万后redis-sentinel容易宕机,但使用基于磁盘IO思路的分布式框架mongodb_scrapy,虽性能略差,但是拥有更低的成本,爬虫的过程数据都可保存,减少piplines的阻塞,释放了各节点的内存空间。
2.通用的网页正文解析:
re,xpath,bs4等网页解析技术缺乏通用性。通过本方案,使用行块函数进行分割,快速解析web正文,正确率达95%,解析快,成功应用到自动化爬虫项目。
3.NLP处理实例:
自然语言的分类,正负向,观点提取,近义词,概要,错别字均可成熟稳定的实现。尚在探索的,运用rnn/cnn自动写作,吟诗作赋,创作歌词技术。
4.深度挖掘实例:
CNN的万能打码模型和图像中文本识别