OCR迭代项目,采用deep_text 模型作为基础框架进行训练,训练数据主要包括天池比赛数据集,以及常见的中文开源数据集CTW等,还有合成的数据,总共的数据量大概100万+,测试集以天池比赛的评估为准,以及评估实际的上线情况。模型迭代完成后,在天池比赛排名第5(总共1200+支
多模态对话模型,采用了14B的Qwen-VL作为基础模型,下载预训练的权重参数,对于讲解垂类领域的问答,通过两种方式来增强模型的对话能力,一种是准备微调数据集,人工筛选,经过自动化工具进行数据扩充,进行微调训练;另一种是通过RAG方式,使用垂类的文本数据作为基础数据库,先进行数据
我是主要负责人,采用了两阶段方式,第一阶段使用了分类模型,首先对所有的图片进行分类,筛选地标图片,主要是为了提升识别准确率;第二阶段,在此基础上,使用yolov8 作为基础模型,对地标进行检测识别。 整个项目,需要先收集训练数据集,通过爬虫方式爬取国内外网站的地标图片,人工简单
鼠标悬停或点击上方资质图片,可放大右下角二维码进行扫码验真。
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如该工程师当前档期不合,也可免费为您推荐相似候选人