本项目来源于真实外呼业务中的NLP意图识别实践,主要目标是通过训练数据清洗、意图标签规范、模型训练支持和效果评测,提高模型对用户真实表达的识别能力。
项目首先结合外呼业务流程梳理用户意图分类,分析确认、拒绝、犹豫、咨询、无效回答及相近业务意图之间的边界,协助完善标签定义、标注规范和特殊样本处理规则。随后对原始对话文本执行去重、无效内容过滤、格式统一、标签一致性检查和异常样本整理,提高训练数据质量。
在训练支持阶段,根据项目要求配置训练相关参数,记录训练数据版本、模型版本和测试结果。模型完成训练后,使用测试样本和真实业务样本进行人工评测,重点分析误判、漏判、低置信度、相近意图混淆、口语化表达和上下文缺失等问题。
针对模型错误结果建立错误案例分类,将问题反馈到数据清洗、标签规则和训练样本环节进行迭代。同时结合外呼业务漏斗、用户响应和后续转化数据,判断模型离线评测结果是否能够支持真实业务应用。
本人主要参与业务意图梳理、数据清洗、训练数据标注与质检、训练参数配置、模型效果测试、错误案例分析和真实业务验证。该项目使本人积累了从业务需求、训练数据准备、模型训练支持、模型评测到业务效果复盘的完整实践经验。