本项目基于Qwen-TTS、CosyVoice开源模型,面向客服机器人场景完成生产级落地优化。负责前端文本归一化模块开发,通过规则+小样本LLM方案解决多音字、数字、计量单位发音错误问题;采用LoRA轻量化微调方案,依托客服场景语料优化音色、停顿与韵律表现,优化长文本智能分句逻辑,改善大段文本断句生硬、语气割裂问题。
完成流式Streaming-TTS推理改造,基于WebSocket实现音频分片边生成边推送,降低首包播放延迟;通过vLLM+混合精度推理、动态Batch批量请求优化并发性能,使用FastAPI封装服务并Docker容器打包部署,最终交付可商用高可用TTS服务,满足低延迟、高并发的生产使用标准