中文拼写纠错

人工智能 · 其他 案例ID: 243123
联系该工程师
微信扫码,建群沟通
作者: Yang - 3年经验- 菜鸟

案例介绍

1. 数据优化:1)数据增强,BERT 生成错别字。2)数据去噪,NNLM 过滤伪正例,Co-teaching 解决不完全/不正确标注(伪负例)。
2. 解决过纠正:1)BERT 首次引入 CopyNet 机制,生成时动态加大原输入字的生成概率,F1 值提高 2%。2)检测&纠正联合模型。
3. 解决连续错字:1)预测层多轮解码,recall 提 2%。2)Beam search + NNLM +阈值筛选,F1 提 1%。3)对比学习,F1 提 1%。
4. 错别字粗召回:在纠错模型前过滤不含错别字的句子。用 ERNIE 蒸馏 RoBERTa_tiny,训练方式为“序列标注+句子级别二分类”
的多任务。在保召回率 95%下,相比蒸馏前,过滤比例从 39.41%降到 29.43%,但推理性能提升 20 倍,模型可实用。

相似案例推荐

发布任务

企业点击发布任务,工程师会在任务下报名,招聘专员也会在 1 小时内与您联系确认。

1小时精推人才

需求方专属客服,免费梳理匹配

需求方客服微信二维码
扫码加微信 · 客服人工对接
微信沟通 联系需求方端客服 看中这位工程师了?客服帮你 1 小时对接沟通 → ×