该项目面向多来源业务数据格式不统一、人工清洗效率低以及传统规则维护困难等问题。我负责整体流程设计和核心模块开发,使用FastAPI构建任务接口,基于LangGraph编排规则初筛、字段识别、语义映射、规则生成、PySpark批量清洗、质量校验和人工审核流程。LLM仅负责输出结构化
该项目面向社媒、新闻等多源数据分析场景,解决固定NLP流水线扩展困难、业务规则维护成本高以及异常任务难以恢复的问题。我负责Agent架构设计及核心模块开发,基于FastAPI、LangGraph、Celery和Kafka构建Router、Planner、Supervisor及多个
该项目面向海外主流内容社区及500+行业垂直站点,解决多站点任务调度、动态页面渲染、复杂访问限制、多语种非结构化内容解析及重复采集问题。我负责分布式增量采集架构和核心模块开发,基于Scrapy-Redis与Scrapyd构建采集矩阵,使用Redis BloomFilter实现亿级