该项目面向多来源业务数据格式不统一、人工清洗效率低以及传统规则维护困难等问题。我负责整体流程设计和核心模块开发,使用FastAPI构建任务接口,基于LangGraph编排规则初筛、字段识别、语义映射、规则生成、PySpark批量清洗、质量校验和人工审核流程。LLM仅负责输出结构化映射建议,实际数据处理由Python和PySpark确定性执行,避免模型直接修改生产数据。系统同时接入Kafka、Celery、Redis、Elasticsearch和HBase,实现任务状态追踪、异常重试、低置信度人工介入及结果落库。
需求方专属客服,免费梳理匹配