对原有的线上新闻分类算法进行优化,从传统机器学习转入深度学习,采用TextCNN、TextRNN等算法对新闻类数据进行分类,线上平均准确率在99%左右,较原先有了大幅度的提升;
对query-title数据进行文本清洗、分词等预处理操作,并构建模型训练集;
分别采用文本分类模型TextCNN、文本匹配模型DSSM、预训练模型BERT等进行训练,生成每个query和title的Embedding表征;
线上服务采用基于Flask框架开发的实时向量召回引擎,实时生成query向量,
并基于Faiss框架快速检索相似度最高的title进行召回。