这是一种“网络爬虫”,用于抓取网站的数据。最初实施于某国家级政府机关单位,用于抓取国外特定网站上的数据,包括日韩欧美等近20个特定网站上的数据。后又用于抓取其它多个领域的网站数据
1. 功能特点
可以对要抓取数据的网站进行配置,核心代码根据配置对各个网站进行解析,获取有用数据存储入库,可以进行复杂的数据提取,比如下载分页的pdf附件,在附件可有可无、名称不确定、页数不确定的情况下也能正确抓取;
可以指定抓取某个网站上的某个网页的某个区域的数据;
可以模仿人工浏览网页的方式执行数据抓取。比如抓取某网站的pdf文件,手工操作按照这些步骤进行:第一步需要先输入用户名密码后登录,第二步进入搜索界面按照关键字进行搜索,第三步在搜索到的结果列表中找到某行信息;第四步下载者此信息的附件pdf,pdf是分页浏览器的。在这种情况下可以通过配置后准确的抓取全部页数的pdf文本。
2. 技术特点
对抓取的数据通过xml文件进行配置,以便网站版面、样式等发生改变的时候能够及时调整;
强大的地方是配置文件中可以编写脚本;
采用java语言编制,可以方便的嵌入到各种系统中。
G端项目,某省福彩一体化项目,包含全省福彩的服务后台,彩民/
救助核对一体化项目,本项目主要针对救助核对业务进行设计 我
使用vue2、vuex、vue-router开发的一个公司内
企业办公软件,企业办公软件企业办公软件企业办公软件企业办公软
项目名称:数字化智能制造中心 开发环境:IDEA+Git+
个人开发软件,已经上传到华为市场,酷安市场,Google P
需求方专属客服,免费梳理匹配
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如当前档期不合,也可免费为您推荐相似案例作者