岗位描述
岗位职责:
1.参与网页端及移动端爬虫系统的开发与维护工作;
2.设计合理的爬虫策略,优化抓取流程,提升数据抓取效率和质量;
3.研究并应对常见反爬机制,如 IP 限制、验证码、动态渲染等;
4.在开发过程中能独立分析问题并提出解决方案。
任职要求:
1.熟悉 Python 编程语言,具备良好的编码习惯;
2.理解爬虫基本原理,有实际项目开发经验;
3.熟悉常见的反爬虫技术,如 IP 代理、User-Agent 伪装等;
4.掌握 HTTP 协议,了解 HTML、XPath、正则表达式等数据提取方式;
5.熟悉 Scrapy 或 Scrapy-Redis 爬虫框架的使用;
6.熟悉 Redis 的基本操作,了解其在爬虫中的应用场景;
7.了解 MySQL、Elasticsearch、Kafka 等数据库/中间件的基本使用;
8.有海外社交媒体等平台采集经验优先;