远程监管被广泛用于使用自动标记的数据集提取关系事实,以减少人工标注的高成本。但是,当前的远程监督方法存在单词级和句子级噪声的共同问题,这些问题源于句子中大量不相关的单词和许多句子的不正确的关系标签。这些问题导致关系提取的精度无法接受,这对于使用远程监管的成功至关重要。在本文中,我
一、 豆瓣信息爬取和知识图谱构建 1、使用python scrapy爬取豆瓣读书(https://book.douban.com/tag/?view=type&icn=index-sorttags-all)下的图书基本信息,包括:类别、名称、作者、出版社、出版时间、价格