本项目为个人主导的大语言模型工程化实践项目,目标是解决多个模型接口不统一、任务适配能力不同、评测结果分散以及模型调用过程缺少审计的问题。
项目采用Python开发,以JSON和YAML进行配置管理,完成Qwen、DeepSeek、Kimi等多个大语言模型的统一注册、接口连通测试、请求参数管理、候选答案生成、多评委评分、评分结果提取、模型能力画像和路由决策。
在模型执行流程中,根据任务复杂度设计Top1、Top3和Top5调用模式,并综合技能匹配度、历史成功率、稳定性、置信度、调用成本和失败记录进行模型选择。针对接口超时、响应格式异常、评分缺失和模型调用失败等情况,设计超时处理、失败回退、结果完整性检查和人工复核机制。
项目同时引入预算限制、操作日志、版本记录和人工审批门禁,使模型调用、评测结果和配置变更均可追踪。使用Conda管理Python环境,使用Git进行分支、版本和变更管理,并通过命令行校验程序检查配置文件和运行结果。
本人主要负责需求拆解、系统流程设计、Python工具开发、模型接口配置、评测规则设计、运行验证、异常排查及项目文档整理。该项目体现了本人在Python后端、大模型API接入、模型评测、配置管理、模型路由和工程审计方面的实践能力。