岗位描述
岗位职责
团队介绍:AI 数据与安全团队为 Seed 基座模型及 AI 原生应用提供跨模态数据服务,覆盖数据生产全流程,包含模型评估标准的制定、数据规模化生产、数据飞轮搭建,不断提升数据质量,支持模型快速迭代。
团队由产品经理、数据工程、数据运营等跨职能人才组成,并通过与 Seed 研究员、行业专家、全球顶尖数据供应商紧密合作,从真实场景中收集反馈并分析模型表现数据,解决 AI 前沿突破过程中的复杂数据问题,推动模型性能与用户体验的双重提升。我们既是帮助模型技术迭代的一线贡献者,也是模型和 AI 产品的一手用户。
日常实习:面向全体在校生,为符合岗位要求的同学提供为期3个月及以上的项目实践机会。
1、参与Seed基础模型Coding Agent方向的数据运营与项目交付,根据模型训练和模型能力缺口优化需求,推进数据生产、验收、交付和复盘;
2、负责专家资源的招募、筛选、匹配与运营,根据不同模型能力、技术Domain和任务类型,寻找合适的软件工程师、算法研究员、科研人员等专业人才;
3、协助分析Coding Agent的代表性任务,理解任务考察能力,并围绕GitHub Repo/Issue/PR、Paper、Dataset、官方文档、技术社区等渠道组织高质量数据源挖掘;
4、负责专家数据生产任务的运营,包括任务拆解、SOP制定、培训答疑、进度跟进、质量反馈和结果验收,持续提升专家生产效率与数据质量;
5、参与训练数据和Source的质量评估,识别重复、弱相关、低价值或不可验证的数据,结合规则、Rubric和Agent工具建立标准化验收流程,根据模型效果、数据验收结果和专家反馈分析数据生产中的问题,持续优化专家画像、生产SOP、验收标准和运营流程;
6、探索Agent在数据运营中的应用,通过自动化工具辅助模型能力缺口分析、专家匹配、质量检查和数据整理,提高整体数据生产效率。
岗位要求
1、本科及以上学历在读,计算机、软件工程、人工智能、信息管理、理工科等相关专业优先;
2、对大模型、Coding Agent、AI数据、Synthetic Data等方向有浓厚兴趣,愿意深入理解模型训练与数据生产流程;
3、具备较强的信息检索和研究能力,能够快速理解陌生技术领域,并从GitHub、Paper、技术社区、官方文档等渠道寻找高质量信息;
4、具备较强的项目推进能力,能够同时协调专家、算法、研发等多方角色,推动任务按质量要求完成交付,具备较强的沟通能力和责任心,能够进行专家沟通、任务培训、问题反馈和质量管理;
5、具备良好的结构化思考能力,能够将复杂工作整理为清晰的SOP、验收标准和数据表格,对数据质量敏感,能够识别明显错误、低质量内容、重复数据以及与任务目标不匹配的数据;
6、具备基本技术理解能力,能够阅读简单代码、GitHub Repository、Issue/PR和技术文档,不要求进行复杂算法研发;每周可实习4天及以上,连续实习3个月及以上优先。