岗位描述
职位简介:
大疆各产品线坐拥海量真实回传数据,正在用大模型/多模型协同的方式,把"靠人堆标注"的旧范式改造为"模型生模型"的自循环数据引擎。从大模型自动真值生成、数据质量评估、长尾挖掘与主动样本选择,到端到端闭环链路的算法侧设计,再到跨产品线统一的数据飞轮算法底座,我们具备完整技术栈。我们寻找相信"数据闭环决定模型迭代速度天花板"的同路人,与我们一起,让回传数据成为驱动一代代大疆AI模型的永动机。
工作职责:
1. 负责基于大模型/多模型协同的训练真值自动生成算法研发;
2. 负责数据质量评估、长尾场景挖掘与样本主动选择算法;
3. 负责回传数据 → 标注 → 训练 → 评测的端到端闭环链路算法侧设计;
4. 与数据工程、世界模型团队协同,构建跨产品线统一的数据飞轮算法底座。
任职要求:
基本要求
1. 计算机、自动化、数学、统计等相关专业,硕士及以上学历;
2. 扎实的机器学习基础,熟练 PyTorch,理解半监督、自监督、主动学习、弱监督等关键范式;
3. 在大模型/多模型协同自动标注、长尾挖掘、样本选择或数据质量评估任一方向有实战经验;
4. 良好的工程能力,能独立搭建大规模数据筛选、标注、评估管线。
加分项
1. CVPR / ICCV / NeurIPS / ICLR / ICML 等顶会一作论文;
2. 在自动驾驶、具身智能或机器人公司有过端到端数据闭环建设的实战经验;
3. 熟悉 Auto-labeling、Pseudo-labeling、Foundation Model as Annotator 等近一年新范式;
4. 对数据飞轮、Scaling Law、模型迭代效率有自己的思考与代表性作品。