不喝美式

学生
国防科技大学 · 3年经验
不喝美式
日薪: ¥500/8h
地点: 长沙
时间: 可工作日远程可工作日驻场(自由职业原因)
ID:435798 复制

0
接单数
0
评价数
0
收藏数

AI 技能提取 | Python PyTorch
技术栈:Python、PyTorch、潜扩散 LDM、VAE、SVC 歌声转换、Audio 信号处理、Web 前端
项目背景:针对 AI 音色非法克隆问题,实现发布前主动音频防护,在几乎不损伤人耳听感前提下,降低 AI 模型克隆歌手音色的能力。
复现基于 So‑VITS 条件 VAE 的潜扩散防护框架,实现交叉注意力条件注入、异性音色引导、显式身份偏移损失,在潜空间生成不可感知的保护扰动,规避直接波形添加噪声带来的音质损伤。
实现动态预处理鲁棒训练,训练阶段随机模拟压缩、混响、均衡等真实音乐后处理,提升防护在平台转码链路下的鲁棒性。
搭建歌唱多维评价体系:ATD 音色偏离、TSRR 相似度降低率,同时评估音准、节奏、颤音、纯净度,区别传统语音评价指标;在 5 类主流 SVC 模型上完成防御效果验证。
- 开发 Web 交互工作台,完成音频导入、波形预览、保护强度调节、试听下载完整流程;编写完整工程报告,梳理威胁模型、消融实验、伦理边界与部署约束。

项目背景:针对扩散类大模型显存占用高、推理速度慢,设计分层优化方案,兼顾模型体积、推理时延与任务精度。
模型压缩(训练侧 train.py):实现知识蒸馏、FP16 量化、网络结构化剪枝;采用加权蒸馏、集成蒸馏策略,优先保障模型输出效果,平衡参数量与性能损失。
推理性能优化(inference.py):混合精度 FP16 加速,接入 CUDA TensorCore;使用torch.compile、CUDA Graph 做图编译优化,降低推理计算开销。
评测流水线封装(result.py):可调蒸馏温度参数,搭建自动化对比评测脚本,完成原始模型与优化后模型的精度、显存、时延对比;优化路线:无损等价提速 → 结构压缩微调 → 架构迭代升级。
不喝美式 ID:435798 复制

不喝美式

学生 · 3年经验 · 国防科技大学
城市长沙 日薪500元/8h 时间 可工作日远程可工作日驻场(自由职业原因)
0
累计接单
0
用户评价
0
被收藏

信用行为

0
接单数
0
评价数
0
收藏数

技术能力

AI 技能提取 | Python PyTorch
技术栈:Python、PyTorch、潜扩散 LDM、VAE、SVC 歌声转换、Audio 信号处理、Web 前端
项目背景:针对 AI 音色非法克隆问题,实现发布前主动音频防护,在几乎不损伤人耳听感前提下,降低 AI 模型克隆歌手音色的能力。
复现基于 So‑VITS 条件 VAE 的潜扩散防护框架,实现交叉注意力条件注入、异性音色引导、显式身份偏移损失,在潜空间生成不可感知的保护扰动,规避直接波形添加噪声带来的音质损伤。
实现动态预处理鲁棒训练,训练阶段随机模拟压缩、混响、均衡等真实音乐后处理,提升防护在平台转码链路下的鲁棒性。
搭建歌唱多维评价体系:ATD 音色偏离、TSRR 相似度降低率,同时评估音准、节奏、颤音、纯净度,区别传统语音评价指标;在 5 类主流 SVC 模型上完成防御效果验证。
- 开发 Web 交互工作台,完成音频导入、波形预览、保护强度调节、试听下载完整流程;编写完整工程报告,梳理威胁模型、消融实验、伦理边界与部署约束。

项目经验

项目背景:针对扩散类大模型显存占用高、推理速度慢,设计分层优化方案,兼顾模型体积、推理时延与任务精度。
模型压缩(训练侧 train.py):实现知识蒸馏、FP16 量化、网络结构化剪枝;采用加权蒸馏、集成蒸馏策略,优先保障模型输出效果,平衡参数量与性能损失。
推理性能优化(inference.py):混合精度 FP16 加速,接入 CUDA TensorCore;使用torch.compile、CUDA Graph 做图编译优化,降低推理计算开销。
评测流水线封装(result.py):可调蒸馏温度参数,搭建自动化对比评测脚本,完成原始模型与优化后模型的精度、显存、时延对比;优化路线:无损等价提速 → 结构压缩微调 → 架构迭代升级。
客服二维码

没找到合适的人才?

扫码添加客服极速匹配,或直接发布需求让更多人才主动报名

平台担保交易 · 1小时内不满意可退款

平台信誉与实力

基于 35,336 需求方信任

  • ✓ 支付宝企业信用分 优秀 评级
  • ✓ 市场份额约占全行业三分之一
  • ✓ 程序员兼职行业全能首选平台
查看平台资质详情
收藏