1. 数据优化:1)数据增强,BERT 生成错别字。2)数据去噪,NNLM 过滤伪正例,Co-teaching 解决不完全/不正确标注(伪负例)。
2. 解决过纠正:1)BERT 首次引入 CopyNet 机制,生成时动态加大原输入字的生成概率,F1 值提高 2%。2)检测&纠正联合模型。
3. 解决连续错字:1)预测层多轮解码,recall 提 2%。2)Beam search + NNLM +阈值筛选,F1 提 1%。3)对比学习,F1 提 1%。
4. 错别字粗召回:在纠错模型前过滤不含错别字的句子。用 ERNIE 蒸馏 RoBERTa_tiny,训练方式为“序列标注+句子级别二分类”
的多任务。在保召回率 95%下,相比蒸馏前,过滤比例从 39.41%降到 29.43%,但推理性能提升 20 倍,模型可实用。
需求方专属客服,免费梳理匹配