岗位描述
岗位职责
工作职责:1、负责大模型训练、测试数据集的全流程采标管理,制定数据采集策略,筛选优质数据来源,保障数据的合法性、多样性与平衡性;2、监督标注过程,审核标注结果,确保标注数据满足模型训练精度要求。3、负责大模型数据集的全生命周期管理,包括数据入库、分类、归档、版本控制、更新与销毁等。4、开展大模型数据安全与合规评估工作,严格遵循《数据安全法》《个人信息保护法》等国内外相关法律法规,建立数据安全防护机制,落实数据分类分级保护要求,防范数据泄露、篡改、滥用风险。5、协同算法团队,明确模型训练、测试的数据需求,提供数据支持与优化建议;跟踪数据治理领域前沿技术,引入大模型辅助数据分类、清洗、标注等创新方法,优化数据管理流程与效率;编写数据管理相关文档,沉淀数据管理规范与经验。
岗位要求
任职要求:1、本科及以上学历,电子信息、计算机、软件工程等相关专业,3年及以上AI领域数据管理、数据治理相关工作经验,有大模型数据集管理经验者优先。2.、熟练掌握Python编程语言,熟悉数据处理工具(Pandas、NumPy等),了解大数据处理技术(Hadoop、Spark)及主流数据库技术;熟悉至少1种数据标注工具(LabelStudio、百度飞桨标注工具等),了解数据清洗、去重、标注等核心流程。3、熟悉国内外数据安全与隐私保护相关法律法规及行业规范,了解数据合规评估方法(如隐私保护影响评估PIA)、数据脱敏(匿名化、去标识化)等合规技术,能独立开展数据安全合规评估工作。4、具备数据集采标、标注管理、质量管控相关经验,有大规模AI训练数据(百万级及以上)治理实操经验者优先;熟悉大模型训练对数据的需求(多样性、平衡性、标注精度),了解数据漂移的检测与应对方法者加分。