锦鲤求职

北京工信国际科技发展有限责任公司

数据采集岗位实习生

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责:
1.负责多源数据的采集与更新,重点覆盖微信公众号、动态渲染网页、政府及行业门户、RSS 等公开信息源;
2.编写和维护爬虫脚本,攻克动态加载、登录鉴权、验证码、IP限制等各类反爬场景;
3.善用AI辅助编程(vibe coding)快速搭建、调试和迭代采集方案,高效解决非标准数据源的抓取难题;
4.搭建和优化自动化采集流程,监控任务运行状态,及时排查异常并修复;
5.对采集数据进行清洗、去重、结构化入库,核验来源可靠性与数据准确性;
6.配合研究团队完成专题数据的定向采集与整理,形成规范化数据集。

任职要求:
1.硕士、博士在读(计算机、软件工程、数据科学、信息管理等相关专业优先);有扎实爬虫实战经验者,专业不限;
2.熟悉 Python 爬虫,掌握 requests、Scrapy、Selenium、Playwright 等框架,能处理 JS 动态渲染页面;
3.有微信公众号文章采集经验,了解公众号数据获取的常见思路与限制;
4.熟悉主流反爬机制及应对方法(动态加载、参数加密、字体反爬、请求签名、代理 IP 池等);
5.擅长使用 AI 编程工具(如 Claude、Cursor、Copilot 等)辅助完成数据采集,能通过 vibe coding 快速验证和落地想法;
6.熟悉 HTML/CSS/XPath/正则,掌握 JSON/CSV/API 数据解析;
7.了解 pandas 数据清洗与 SQL/SQLite 基本操作;
8.动手能力强,遇到难采的数据源愿意钻研、快速试错,不轻易放弃;
9.细心严谨,对数据准确性和来源可靠性有较高要求;
10.独立解决问题能力强,能借助 AI 工具高效完成任务;
11.时间灵活,实习或兼职均可,能保证一定的在线时长与任务响应速度;
12.加分项:定时任务(cron/APScheduler)、Feishu/钉钉 Webhook 通知、抓包分析(Charles/Fiddler)、逆向经验。

数据方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →