一、基于大模型的落地应用(写作,问答、摘要等)
(1)熟悉大模型进行增量预训练的操作(continue pretrain)
(2)熟悉基于DeepSeek、Qwen,Chatglm、Baichuan等大模型的微调。
(3)熟悉大模型进行DPO、SIMPO等强化学习的训练过程。
(4)熟悉对标书、text2sql、法律等领域数据集的处理策略。
(5)熟悉对大模型进行推理加速(rtp-llm、vllm)量化(GPTQ)等操作,显著降低显存占用
(6)熟悉检索增强生成技术RAG,配合大模型一块使用,提高模型的生成质量。
(7)有大模型在实际场景的落地应用经验。
二、基于大模型进行内容写作的落地应用
项目简介:基于大模型进行公文内容自动生成。
工作内容:(1)收集最新的公文数据集,对数据集进行清洗。(2)选用Baichuan-7B,Qwen1.5-7B、ChatGlm4作为基础模型,基于基础模型,在大量的数据预处理的公文数据上持续预训练。(3)收集大量的 instruction pairs 数据,包括非公文的和公文的,然后进行有监督的微调(Supervised Fintune)获得领域模型.
三、基于PEGASUS模型的文本摘要算法
项目简介:对公文的全文内容进行简要描述,形成能概括公文主旨的一小段文字内容。
工作内容:(1)基于textrank算法抽取公文中的重要句子:对文章内容进行分句和分词处理、基于分词结果构建有向无权图、计算句子权重、根据句子权重值对句子进行排序、抽取文章标题与重要句子拼接作为关键句。
(2)以mT5模型为基础架构和初始权重,通过类似PEGASUS的方式进行训练,模型定义为t5-pegasus。对标注的文本摘要数据集进行清洗获得3万多条有效数据,基于这些数据进行模型训练
四、基于demucs与splitter模型进行音频文件分割。
(1)其中demucs支持2和4轨道的分离。
(2)spleeter支持2、4、5轨道的分离。
(3)支持"mp3", "ogg", "m4a", "wav", "flac"等多种格式的音频文件。
(4)支持基于时间戳的动态 token校验和https协议通信。
(5)基于nginx和openssl的域名配置。
五、基于预训练模型的翻译模型算法
项目简介:利用大量的单语数据进行预训练,通过知识蒸馏算法从预训练模型中获取知识来提高翻译模型的效果。
工作内容:(1)基于fairseq深度学习框架,进行翻译模型的研发。(1)对平行语料进行预处理主要包含unicode_normalize;html_unescape;remove_other_symbols(2)设计知识蒸馏的算法主要包含word-level和sentence-level以及sequence-level三种类型的知识蒸馏方法。(3)利用大量的单语数据进行模型的预训练。(4)探索多语言模型XLM-R、MBART等多语言模型的训练和推理方法。
六、猫耳虚拟偶像机器人系统
项目简介:设计一个知识渊博的虚设偶像男友,通过与该偶像男友进行聊天获得想了解的答案。
工作内容:(1)设计算法架构流程图,主要包含意图识别、QA问答、阅读理解、闲聊生成、实体识别等模块。(2)设计基于BERT预训练语言模型的意图识别、QA问答模块模型的研发和部署。