项目一:外呼业务意图识别模型训练与效果评测
项目背景:
参与面向真实外呼业务场景的意图识别项目,通过对用户对话文本进行数据清洗、标注和模型评测,提升模型对不同用户表达方式及业务意图的识别能力。
主要工作:
1. 根据实际业务流程梳理用户意图分类,协助完善意图标签、标注规范及边界样本处理规则。
2. 对原始对话数据进行清洗、去重、无效数据过滤及格式整理,检查样本内容和标签是否一致。
3. 参与训练数据标注与质量检查,分析容易混淆的相近意图、口语化表达及上下文不完整等问题。
4. 根据项目要求配置模型训练相关参数,配合完成训练任务准备、模型版本记录和效果验证。
5. 对模型输出进行人工评测,整理误判、漏判、低置信度和边界案例,并反馈至数据及训练环节进行迭代。
6. 结合真实外呼业务结果开展模型验证,分析意图识别效果与业务漏斗、用户响应及后续转化之间的关系。
项目成果:
积累了从业务意图定义、训练数据准备、数据质量控制、模型评测到真实业务验证的完整实践经验,能够从数据和业务两个角度定位模型效果问题,而不是仅关注单一离线评分。
项目二:多模型评测、路由与审计平台
项目背景:
为解决多个大语言模型在不同任务上的能力差异、调用成本和稳定性问题,设计并实现一套配置驱动的多模型注册、调用、评测、路由和审计流程。
技术与工具:
Python、JSON、YAML、命令行工具、模型API、Conda、Git、PowerShell。
主要工作:
1. 对Qwen、DeepSeek、Kimi等多个模型进行统一注册和配置管理,记录模型名称、接口参数、调用状态及适用任务。
2. 编写模型连通性验证和冒烟测试流程,检查接口地址、鉴权信息、请求参数、返回结构及异常信息。
3. 构建候选答案生成流程,使多个模型能够针对同一评测任务分别输出结果,并按照统一目录保存。
4. 设计多评委评分机制,从准确性、完整性、相关性、风险、稳定性等维度对模型答案进行评估。
5. 实现评分结果提取、汇总和异常检查,避免评分缺失、返回格式不一致和无效结果直接进入后续流程。
6. 设计Top1、Top3和Top5模型路由机制,综合考虑技能匹配度、历史成功率、稳定性、置信度和调用成本。
7. 增加人工审核、CEO确认、预算限制、失败降级和操作审计机制,使高风险模型操作保留人工控制入口。
8. 使用Git管理配置和代码版本,通过配置校验、运行日志及变更检查保证不同模型和不同任务之间可追踪。
项目成果:
完成多个模型的真实接口连通和基础冒烟测试,跑通候选生成、多评委评分、评分提取、人工复核和技能分更新草案等流程;形成了对大模型评测、模型路由、成本治理和工程审计的系统理解。
项目三:Python学习日志管理与模块化后端工具
项目背景:
为记录个人AI学习进度和每日学习数据,使用Python开发本地学习日志管理工具,实现数据录入、持久化保存、查询和统计。
技术与工具:
Python 3.11、JSON、模块化开发、文件读写、异常处理、Conda、PyCharm、Git、Gitee。
主要工作:
1. 将程序拆分为主程序、输入处理、计算逻辑和报告输出等模块,降低代码耦合。
2. 设计学习记录的数据结构,保存学习日期、学习内容、学习时长和完成情况等信息。
3. 使用JSON文件实现数据持久化,使程序关闭并重新运行后仍能读取历史记录。
4. 开发菜单循环和用户输入处理,对无效选项、数字转换和空内容进行基础校验。
5. 在新增记录后立即保存文件,降低程序异常退出导致的数据丢失风险。
6. 使用Git分支完成代码管理、提交和远程仓库同步,并处理开发工具配置文件误提交问题。
7. 对变量传递、函数返回值、模块导入和代码格式问题进行检查和修正。
项目成果:
完成从单文件脚本向模块化Python程序的改造,掌握了JSON持久化、模块职责划分、输入校验、Git版本管理和本地运行验证等后端开发基础。