Arjun的案例列表

智能数据清洗Agent系统

该项目面向多来源业务数据格式不统一、人工清洗效率低以及传统规则维护困难等问题。我负责整体流程设计和核心模块开发,使用FastAPI构建任务接口,基于LangGraph编排规则初筛、字段识别、语义映射、规则生成、PySpark批量清洗、质量校验和人工审核流程。LLM仅负责输出结构化映射建议,实际数据处理由Python和PySpark确定性执行,避免模型直接修改生产数据。系统同时接入Kafka、Celery、Redis、Elasticsearch和HBase,实现任务状态追踪、异常重试、低置信度人工介入及结果落库。...

企业智能数据分析Agent平台

该项目面向社媒、新闻等多源数据分析场景,解决固定NLP流水线扩展困难、业务规则维护成本高以及异常任务难以恢复的问题。我负责Agent架构设计及核心模块开发,基于FastAPI、LangGraph、Celery和Kafka构建Router、Planner、Supervisor及多个业务Agent,实现数据类型识别、执行计划生成、并行分析、异常重试和人工审核。结合Milvus、Elasticsearch与Rerank完成语义检索,分析结果以结构化格式写入MongoDB、ES和HBase。系统最终形成可追踪、可恢复、可人工介入的处理闭环,并支持按业务需求扩展情感分析、实体识别、事件聚类和标题生成等节...

海外内容分布式采集系统

该项目面向海外主流内容社区及500+行业垂直站点,解决多站点任务调度、动态页面渲染、复杂访问限制、多语种非结构化内容解析及重复采集问题。我负责分布式增量采集架构和核心模块开发,基于Scrapy-Redis与Scrapyd构建采集矩阵,使用Redis BloomFilter实现亿级URL去重,结合HTTPX、Playwright和DrissionPage完成静态及动态页面采集;通过Kafka削峰并解耦下游清洗入库,使用ScrapydWeb及监控组件完成任务调度、状态监控和异常告警。系统支持日均百万级数据采集,核心站点成功率约95%,形成可扩展、可监控、可恢复的数据采集链路...

微信沟通 联系需求方端客服 看中这位工程师了?客服帮你 1 小时对接沟通 → ×