任务目标:弱监督视觉落地旨在仅有图像-文本对而没有目标物体位置标注的条件下,定位到与自然语言查询最相关的目标物体。 1. 通过多模态预训练模型为物体框生成伪查询,并利用伪查询与真实查询之间的单模态相似度为样本生成更高质量的伪标签 2. 引入外部多模态大模型抑制噪声对模型训
视觉定位旨在根据自然语言查询定位图像中提及的目标物体。尽管近期已取得一定进展,但在存在多重实例干扰(与目标同类的多个物体)的场景中准确定位目标物体仍面临重大挑战。现有方法在图像存在多重干扰时表现出显著的性能下降,这表明模型对物体间细粒度语义及空间关系的理解仍存在不足。本文提出一种
扫码添加客服极速匹配,或直接发布需求让更多人才主动报名
基于 35,336 需求方信任
鼠标悬停或点击上方资质图片,可放大右下角二维码进行扫码验真。
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如该工程师当前档期不合,也可免费为您推荐相似候选人
收藏后可在“我的收藏”里统一查看,也方便后续继续联系和筛选合适人才。
登录后将自动返回当前页,继续浏览不会丢失。