项目名称:智能三书比对系统
开发环境:操作系统 Windows10,Java 环境:JDK8,开发工具:IDEA,数据库:Postgresql
开发技术: SpringBoot、SpringSecurity、Hibernate、JPA、Kafka
项目描述: 刑事案件的起诉意见书、起诉书和刑事判决书(简称刑事“三书”)是较为规范、结构明确的司法文书,是检察机关案件质量评查的基础,是具有法律权威的案件重要信息。长期以来,“三书”比对靠的是人工阅读、比对,效率较低,容易出现误读,耗费了大量的人工与时间。
本项目基于深度学习图像文字识别(OCR)技术、自然语言处理(NLP)技术,将图像内容进行文本化、结构化处理,对除犯罪事实外的案件相关信息进行自动结构化和智能比对,基于比对结果进行统计分析,减轻了人工比对和统计的工作量,对数据的深度分析提供了便捷的途径。
功能模块: 登录,抽取案件,OCR 进行图像识别,NLP 自然语言处理数据,根据罪名编写 groovy 脚本处理解析后数据根据规则进行比对操作,统计分析模块
负责模块:主要负责的是登录,案件抽取,接受发送 OCR、NLP 消息,groovy 脚本编写,规则比对,统计分析模块。
登录:使用 SpringSecurity 安全框架完成登录认证操作。
案件抽取:从全国统一业务系统抽取(调用接口形式)需要比对案件的三份文书下载文书 (pdf,world 格式)到服务器,并将文件格式转换为 jpg 或 png 格式进行存储,同时生成一份该案件文书图片目录信息的 json 数据发送 OCR,OCR 根据 json 数据去服务器上获取相应的 pdf进行图像识别解析。
接收发送 OCR、NLP 数据:接收 ocr 图像识别后的数据,根据案件整合案件信息、嫌疑人信息后发送给 nlp 进一步处理。
groovy 脚本规则编写:该系统共分为 12 个私有罪名,根据不同罪名设有不同规则,以及 12 个罪名共有的规则编写(例如:案发时间、地点、刑罚、刑期等规则)groovy 脚本。
规则比对:将解析处理好的结构化数据,按照案件罪名进一步处理相应字段,入库并在页面展示三分文书提取的相同字段值是否一致,默认给出程序的比对结果,如果程序比对错误,人工也可以动修改比对结果。
统计分析:同根据比对结果进行统计分析,一段时间内,针对智能比对结果不通过频率最高的前五条规则字段统计并用柱状图展示、同时提供承办人工作量统计。