项目一:
目标:对任一张打印的电子表格进行识别和电子化处理
实现方式:1.识别表格有多少行,每行的栏数有几个,进行表格版式的电子版复现;2.识别表格中的内容,包括印刷体的汉字、数字和手写体的数字。3.对不清晰和有噪点的纸张进行一定的预处理。
实现方法:1.用opencv加载已经训练好的文字识别模型;2.进行表格版式的识别;3.文字定位;4.文字识别。
结果:已在公司内部项目中实际使用,效果较好。
项目二:
目标:对一本案卷中不同的类型的文档进行分类
实现方式:1.对文档进行标题定位+识别;2.不能识别文字的使用SVM分类器来分类;3.对特定格式的文档进行特定判断。
结果:已在公司内部项目中实际使用,效果较好。