核心功能模块:包含单文件转换、文件夹批量转换、图片提取保存、表格结构化识别、标题层级自动识别、页眉页脚智能过滤、YAML 元数据生成七大核心能力
双模式调用:既支持命令行 CLI 直接调用(支持 8 种自定义参数),也支持作为 Python 包导入到业务代码中集成使用
AI 适配优化:转换后的 Markdown 完整保留原文档层级结构,专门适配大模型输入格式,有效降低 AI 解析成本与 Token 浪费
本人独立完成整个工具的需求设计、架构搭建与全部代码开发
采用分层模块化架构,拆分解析层、转换编排层、格式化层、CLI 接口层,模块解耦性强便于后续扩展
基于 Python + pdfplumber 技术栈实现,解决了 PDF 标题层级精准识别、表格结构化转换等难点,完美支持全中文文档与批量处理