岗位描述
部门介绍
Marketplace Intelligence and Data 团队的使命是建立先进的大规模数据和智能产品来促进Shopee电商业务的发展。团队负责Shopee电商数仓建设,商家与运营数据产品建设,全链路流量数据;商品算法,包括商品发布、管控、信息优化、SPU库及其比价业务;智能客服算法,包括店铺客服问答、商品导购、平台客服;营销算法,包括招商、选品、推荐算法,评价算法,用户画像;此外,还包括机器翻译,语音算法,图像算法,实人认证等基础AI能力。
岗位职责
1. 基于平台的实际反爬策略,从“攻防视角”提出完整的数据采集方案,包括会话管理、模拟人类行为、IP/指纹/设备伪装、JS 混淆等。
2. 研究海外主流社媒的 Web/H5 接口特征,设计稳定、高成功率的采集链路(直抓、接口模拟、浏览器自动化、分布式抓取等)。
3. 开发并维护分布式爬虫系统,包括调度、任务分发、数据校验、采集监控等模块。
4. 构建并维护浏览器自动化工具链(Playwright / Puppeteer / CDP / mitmproxy 等),实现高稳定性的采集流程。
5. 持续跟踪社媒接口变化、反爬策略和风控机制,提供迭代与优化方案。
6. 输出技术文档,包括架构设计、接口逆向细节、风控策略分析及风险提示。
岗位要求
1. 3 年以上爬虫 / 反爬 / Web 安全相关工作经验,计算机或相关专业。
2. 熟悉各类反爬技术,如:登录校验、人机校验(验证码、行为识别)、风控限流、请求签名/加密等。
3. 熟练使用 Puppeteer / Playwright / Selenium 等浏览器自动化框架。
4. 熟悉 HTTP 协议、WebSocket、TLS、Cookie/Session 机制 等基础网络知识。
加分点
1. 有处理 Cloudflare / Akamai / PerimeterX / hCaptcha / reCAPTCHA 等反爬体系经验者优先。
2. 有反指纹浏览器(如 FingerprintJS、Multilogin、AdsPower、Kameleo 等)使用或集成经验。
3. 有大型爬虫系统、分布式调度、任务队列(Celery、Kafka 等)实践经验者优先。