廾匸的案例列表

多模型评测与路由平台

人工智能-其他 廾匸

本项目为个人主导的大语言模型工程化实践项目,目标是解决多个模型接口不统一、任务适配能力不同、评测结果分散以及模型调用过程缺少审计的问题。 项目采用Python开发,以JSON和YAML进行配置管理,完成Qwen、DeepSeek、Kimi等多个大语言模型的统一注册、接口连通测试、请求参数管理、候选答案生成、多评委评分、评分结果提取、模型能力画像和路由决策。 在模型执行流程中,根据任务复杂度设计Top1、Top3和Top5调用模式,并综合技能匹配度、历史成功率、稳定性、置信度、调用成本和失败记录进行模型选择。针对接口超时、响应格式异常、评分缺失和模型调用失败等情况,设计超时处理、失败...

多模型评测与路由平台
多模型评测与路由平台

意图识别训练评测系统

人工智能-其他 廾匸

本项目来源于真实外呼业务中的NLP意图识别实践,主要目标是通过训练数据清洗、意图标签规范、模型训练支持和效果评测,提高模型对用户真实表达的识别能力。 项目首先结合外呼业务流程梳理用户意图分类,分析确认、拒绝、犹豫、咨询、无效回答及相近业务意图之间的边界,协助完善标签定义、标注规范和特殊样本处理规则。随后对原始对话文本执行去重、无效内容过滤、格式统一、标签一致性检查和异常样本整理,提高训练数据质量。 在训练支持阶段,根据项目要求配置训练相关参数,记录训练数据版本、模型版本和测试结果。模型完成训练后,使用测试样本和真实业务样本进行人工评测,重点分析误判、漏判、低置信度、相近意图混淆、口...

意图识别训练评测系统
意图识别训练评测系统
------ 加载完毕 ------
联系需求方端客服