锦鲤求职

携程

数据采集系统开发工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

工作职责:

开发和维护大规模分布式数据采集系统,覆盖 Web、App、视频图文等多形态数据源;

负责目标站点的技术分析与优化,确保数据采集的合法合规性,并完成相关技术实现;

结合 AI 技术提升采集效率与智能化水平:用 LLM/VLM 完成页面结构化抽取、非结构化正文清洗与多模态内容理解;

探索 Agent 化采集,实现采集脚本自动生成、选择器失效自愈与站点变更自动探测;

熟悉业务场景,结合技术趋势迭代系统架构,并与下游团队协作定义采集口径与数据质量指标。

工作要求:

计算机相关专业本科及以上学历,3 年以上后端及数据采集开发经验;

熟练掌握 Python(异步/协程、性能调优)或 Java 同等水平,熟悉 Linux 环境下的工程化开发;

熟悉 Scrapy / Playwright / Puppeteer 等采集工具链,理解 CDP 协议,能构建稳定的自动化采集流程;

具备 JS 技术分析能力(包括 AST 分析、环境搭建、指纹优化、代理池管理),能独立完成从协议分析到稳定采集的闭环;

有大模型落地数据链路的真实项目经验,熟悉 Prompt Engineering、结构化输出、评测集构建与准确率量化,具备成本与延迟权衡意识;

熟悉 MySQL/Redis/Kafka,了解 K8s/Docker 与 Prometheus、Grafana 等监控体系,具备线上问题定位能力;

对数据采集技术充满热情,具备优秀的问题解决、沟通、学习能力和团队合作精神,工作踏实认真负责。

加分项:

有大规模采集平台(日均亿级请求)的平台化建设经验;

有 Agent / 工作流编排、模型微调或小模型替代大模型的落地经验;

有 App 逆向经验,或开源项目、技术博客、CTF 安全竞赛背景。

后端开发方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →