Saber

高级Python工程师(AI Agent/爬虫)
浪潮集团 · 6年经验
Saber
日薪: ¥900/8h
地点: 山东 全区
时间: 下班后周六周日可工作日远程
ID:238824 复制

0
接单数
0
评价数
0
收藏数

AI 技能提取 | Redis 分布式 Python FastAPI 高并发 LangChain Selenium Kafka Java MySQL SQLite Docker JavaScript HTML CSS
1、Python 精通,6 年商业项目开发经验;熟悉 JavaScript / Java / HTML / CSS。
2、AI Agent 开发:熟练使用 LangChain / LangGraph 构建可落地的 Agent 系统;熟悉 MCP 协议与工具调用封装、上下文管理与摘要策略、多轮对话编排;能为 Agent 设计状态门控与调用配额等护栏机制,解决大模型反复探索、步数爆炸的问题;了解 DeepAgents 框架与 multi-agent 协同编排。
3、RAG 检索增强生成:向量数据库(Milvus / Chroma)、BGE Embedding、长文本分块,BM25 词频与向量双路召回的混合检索优化。
4、爬虫与数据采集:精通 Scrapy / Scrapy-Redis 分布式爬虫、Web JS 逆向与 App 逆向;熟练使用 Playwright / Selenium 驱动真实浏览器采集;熟悉 HTTP/HTTPS 协议与抓包分析,以及主流反爬对抗手段(浏览器指纹伪装、动态 IP 代理池、Cookie 自动保活、请求节流与风控熔断)。
5、后端开发:熟练使用 FastAPI 开发接口与 SSE 流式推送,熟悉 asyncio 异步编程与高并发任务调度。
6、数据与工程化:MySQL / SQLite / Redis / Kafka;Docker 与 Docker Compose 容器化部署,supervisor 进程托管与自动化上线;具备从需求到上线的独立交付能力。

1、AI Agent 自动生成并部署爬虫系统(独立开发):用户只输入一个列表页网址,Agent 自动分析网站数据来源与翻页机制、生成 Scrapy 爬虫代码、跑真实数据验证,并自动 git 推送、SSH 部署到生产机由 supervisor 常驻运行。核心设计是不让大模型直接写代码,它只输出结构化 SpiderSpec,由确定性模板引擎渲染,从根上消除代码幻觉;验证环节除识别 403/429/验证码等反爬信号外,还做字段级质量断言,杜绝"抓到了但抓错了"。已为 15 个真实站点生成并验证通过。技术栈:LangChain / LangGraph / MCP / Scrapy / FastAPI / React。

2、多平台 AI 答案采集系统:面向 GEO(生成式引擎优化)场景,在 Docker 中并行调度 12 条采集通道,同时从 4 个主流 AI 对话平台按题采集回答并结构化交付。原始响应体先落盘再解析,解析器升级后可离线重算历史数据;fail-closed 状态机保证异常结果绝不当作有效数据交付;内置请求节流抖动、长休息、浏览器定期回收、风控熔断与人工介入恢复机制。

3、基于大模型的智能数据采集与结构化 ETL 系统:针对研报网、企查查等高风控站点,用 Playwright + 代理池稳定获取底层数据,再把清洗后的杂乱网页文本交由开源大模型直接转为业务所需的标准 JSON,替代脆弱的 XPath / 正则。新增站点的解析规则开发时间从 1 天缩短至 1 小时,解决了目标站前端频繁改版导致的数据断流。

4、GAW-Scraper 通用高并发异步爬虫框架:从 0 到 1 主导设计,底层基于 asyncio 的生产者-消费者协程并发模型,纯 JSON 配置驱动,下发目标 URL 与策略即可自动调度;框架层集成指纹伪装、动态 IP 代理池轮询与 Cookie 自动保活中间件。单节点日均稳定并发采集原始网页 200 万+ 次,新站点接入配置时间缩短 80%。

5、行业资讯 RAG 检索与舆情问答知识库:FastAPI + Qwen / DeepSeek + Milvus + BGE Embedding,引入 BM25 与向量双路召回,解决企业名称、行业黑话在纯向量检索中丢失的问题。内部资料检索平均耗时缩短约 60%,搜索准确率较传统 ES 方案提升约 30%。
Saber ID:238824 复制

Saber

高级Python工程师(AI Agent/爬虫) · 6年经验 · 浪潮集团
城市山东 全区 日薪900元/8h 时间 下班后周六周日可工作日远程
0
累计接单
0
用户评价
0
被收藏

信用行为

0
接单数
0
评价数
0
收藏数

技术能力

AI 技能提取 | Redis 分布式 Python FastAPI 高并发 LangChain Selenium Kafka Java MySQL SQLite Docker JavaScript HTML CSS
1、Python 精通,6 年商业项目开发经验;熟悉 JavaScript / Java / HTML / CSS。
2、AI Agent 开发:熟练使用 LangChain / LangGraph 构建可落地的 Agent 系统;熟悉 MCP 协议与工具调用封装、上下文管理与摘要策略、多轮对话编排;能为 Agent 设计状态门控与调用配额等护栏机制,解决大模型反复探索、步数爆炸的问题;了解 DeepAgents 框架与 multi-agent 协同编排。
3、RAG 检索增强生成:向量数据库(Milvus / Chroma)、BGE Embedding、长文本分块,BM25 词频与向量双路召回的混合检索优化。
4、爬虫与数据采集:精通 Scrapy / Scrapy-Redis 分布式爬虫、Web JS 逆向与 App 逆向;熟练使用 Playwright / Selenium 驱动真实浏览器采集;熟悉 HTTP/HTTPS 协议与抓包分析,以及主流反爬对抗手段(浏览器指纹伪装、动态 IP 代理池、Cookie 自动保活、请求节流与风控熔断)。
5、后端开发:熟练使用 FastAPI 开发接口与 SSE 流式推送,熟悉 asyncio 异步编程与高并发任务调度。
6、数据与工程化:MySQL / SQLite / Redis / Kafka;Docker 与 Docker Compose 容器化部署,supervisor 进程托管与自动化上线;具备从需求到上线的独立交付能力。

项目经验

1、AI Agent 自动生成并部署爬虫系统(独立开发):用户只输入一个列表页网址,Agent 自动分析网站数据来源与翻页机制、生成 Scrapy 爬虫代码、跑真实数据验证,并自动 git 推送、SSH 部署到生产机由 supervisor 常驻运行。核心设计是不让大模型直接写代码,它只输出结构化 SpiderSpec,由确定性模板引擎渲染,从根上消除代码幻觉;验证环节除识别 403/429/验证码等反爬信号外,还做字段级质量断言,杜绝"抓到了但抓错了"。已为 15 个真实站点生成并验证通过。技术栈:LangChain / LangGraph / MCP / Scrapy / FastAPI / React。

2、多平台 AI 答案采集系统:面向 GEO(生成式引擎优化)场景,在 Docker 中并行调度 12 条采集通道,同时从 4 个主流 AI 对话平台按题采集回答并结构化交付。原始响应体先落盘再解析,解析器升级后可离线重算历史数据;fail-closed 状态机保证异常结果绝不当作有效数据交付;内置请求节流抖动、长休息、浏览器定期回收、风控熔断与人工介入恢复机制。

3、基于大模型的智能数据采集与结构化 ETL 系统:针对研报网、企查查等高风控站点,用 Playwright + 代理池稳定获取底层数据,再把清洗后的杂乱网页文本交由开源大模型直接转为业务所需的标准 JSON,替代脆弱的 XPath / 正则。新增站点的解析规则开发时间从 1 天缩短至 1 小时,解决了目标站前端频繁改版导致的数据断流。

4、GAW-Scraper 通用高并发异步爬虫框架:从 0 到 1 主导设计,底层基于 asyncio 的生产者-消费者协程并发模型,纯 JSON 配置驱动,下发目标 URL 与策略即可自动调度;框架层集成指纹伪装、动态 IP 代理池轮询与 Cookie 自动保活中间件。单节点日均稳定并发采集原始网页 200 万+ 次,新站点接入配置时间缩短 80%。

5、行业资讯 RAG 检索与舆情问答知识库:FastAPI + Qwen / DeepSeek + Milvus + BGE Embedding,引入 BM25 与向量双路召回,解决企业名称、行业黑话在纯向量检索中丢失的问题。内部资料检索平均耗时缩短约 60%,搜索准确率较传统 ES 方案提升约 30%。
客服二维码

没找到合适的人才?

扫码添加客服极速匹配,或直接发布需求让更多人才主动报名

平台担保交易 · 1小时内不满意可退款

平台信誉与实力

基于 35,336 需求方信任

  • 支付宝企业信用分 优秀 评级
  • 市场份额约占全行业三分之一
  • 程序员兼职行业全能首选平台
查看平台资质详情
收藏