岗位描述
工作职责:
开发和维护大规模分布式数据采集系统,覆盖 Web、App、视频图文等多形态数据源;
负责目标站点的技术分析与优化,确保数据采集的合法合规性,并完成相关技术实现;
结合 AI 技术提升采集效率与智能化水平:用 LLM/VLM 完成页面结构化抽取、非结构化正文清洗与多模态内容理解;
探索 Agent 化采集,实现采集脚本自动生成、选择器失效自愈与站点变更自动探测;
熟悉业务场景,结合技术趋势迭代系统架构,并与下游团队协作定义采集口径与数据质量指标。
工作要求:
计算机相关专业本科及以上学历,3 年以上后端及数据采集开发经验;
熟练掌握 Python(异步/协程、性能调优)或 Java 同等水平,熟悉 Linux 环境下的工程化开发;
熟悉 Scrapy / Playwright / Puppeteer 等采集工具链,理解 CDP 协议,能构建稳定的自动化采集流程;
具备 JS 技术分析能力(包括 AST 分析、环境搭建、指纹优化、代理池管理),能独立完成从协议分析到稳定采集的闭环;
有大模型落地数据链路的真实项目经验,熟悉 Prompt Engineering、结构化输出、评测集构建与准确率量化,具备成本与延迟权衡意识;
熟悉 MySQL/Redis/Kafka,了解 K8s/Docker 与 Prometheus、Grafana 等监控体系,具备线上问题定位能力;
对数据采集技术充满热情,具备优秀的问题解决、沟通、学习能力和团队合作精神,工作踏实认真负责。
加分项:
有大规模采集平台(日均亿级请求)的平台化建设经验;
有 Agent / 工作流编排、模型微调或小模型替代大模型的落地经验;
有 App 逆向经验,或开源项目、技术博客、CTF 安全竞赛背景。