岗位描述
岗位职责:
1. 主导视觉生成模型全链路数据体系建设,制定数据采集、清洗、标注、配文及多模态对齐的策略与规范,构建大规模、高质量的训练数据集。
2. 负责专用领域数据的定向收集、合成与优化:针对业务场景(如虚拟试穿、数字人驱动)构建精细化数据Pipeline,利用合成数据生成技术解决长尾与稀缺样本问题,建立数据质量评估与模型训练反馈的迭代闭环。
3. 构建自动化数据流水线,包括视频去重、镜头切分、文本-视频对齐等预处理环节,提升数据生产效率
4. 配合完成数据版本的效果验证,分析bad case中的数据归因,迭代优化数据配比与质量策略
任职要求:
1. 计算机电子/图像处理/光学专业优先,硕士及以上学历,计算机视觉/机器学习方向,3年以上生成模型研究或一线大厂核心项目经验;
2. 精通PyTorch与分布式训练框架,掌握主流训练库,有大规模图文、视频数据训练与工程化落地实战经验
3. 在CVPR/ICCV/ECCV/NeurIPS等有影响力的会议/期刊发表一作论文,具备代码开源影响力或权威榜单SOTA成绩者优先
4. 有创新精神和良好的团队合作能力,工作热情,积极负责,具有良好的沟通能力。