任务目标:弱监督视觉落地旨在仅有图像-文本对而没有目标物体位置标注的条件下,定位到与自然语言查询最相关的目标物体。
1. 通过多模态预训练模型为物体框生成伪查询,并利用伪查询与真实查询之间的单模态相似度为样本生成更高质量的伪标签
2. 引入外部多模态大模型抑制噪声对模型训练的影响
3. 在公共的5个数据集上均取得了SOTA的表现
需求方专属客服,免费梳理匹配
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如当前档期不合,也可免费为您推荐相似案例作者