快递信息识别与OCR技术
开发基于Tesseract OCR与深度学习模型(如CRNN、CNN)的快递单信息识别系统,支持多格式单号、收件人信息提取,准确率达98%以上。
结合NLP技术优化地址解析,实现行政区划自动补全与纠错,降低人工录入错误率。
希哈搜索(Shihua Search)开发
主导设计并实现基于Elasticsearch的分布式搜索系统,支持亿级数据毫秒级响应,集成中文分词、语义相似度匹配等算法。
开发搜索结果智能排序模块,结合用户行为数据(点击、停留时长)动态优化排序策略,提升搜索相关性。
PDF综合管理工具开发
使用PyMuPDF、Ghostscript等库实现PDF批量压缩、格式转换、水印添加/去除功能,支持OCR文本提取与多语言识别。
开发PDF元数据编辑工具,可自动提取并修改文档属性(如作者、标题),兼容加密PDF文件的解密与处理。
财务信息自动化录入系统
设计基于RPA(机器人流程自动化)的财务票据处理系统,支持发票、银行对账单的自动分类与信息提取,通过正则表达式与模板匹配技术实现95%以上准确率。
集成OCR与NLP技术,自动识别票据类型并提取关键字段(如金额、日期、交易方),生成标准化结构化数据。
网页数据采集与爬虫开发
精通Scrapy、Selenium等爬虫框架,可高效抓取动态网页、API接口数据,支持反爬策略(如IP代理、User-Agent轮换)与数据清洗。
开发邮箱信息收集工具,结合邮件头解析与语义分析技术,自动提取有效联系人数据并分类存储。