岗位描述
岗位职责
1. 负责数据质量的分级打分:把上游各维度的实测指标加权成可解释的质量等级,输出带前后对比与证据链的质检报告,并给出定价提示;
2. 把分布建模与价值评估做成平台能力:让客户能对自己采集的数据做表示空间分析、分布统计与相似度聚类,得到单批数据边际训练价值的量化结论;
3. 设计自动化数据筛选能力:让客户能按质量分级、多样性与价值密度从自己的数据里挑出训练子集,并支持按任务定制的数据集组装策略;
4. 难例与长尾挖掘能力:让客户能基于覆盖度缺口、失败模式与表示空间稀疏度找出自己数据里的高价值样本,并提供负样本生成与样本均衡策略;算法需区分多样性与低质量,避免把多样性样本当作噪声剔除;
5. 覆盖度与多样性的量化:按任务、场景、操作者维度统计覆盖度并识别分布缺口,为客户产出定向补采清单,回流到采集端与采集指南,指导客户下一轮采什么;
6. 基于内部验证基线建立数据特征与训练表现的关联分析,把模型侧的失败模式转化为数据侧可执行的筛选与挖掘规则,并沉淀为客户可复用的筛选策略;与 VLA 算法工程师协作完成。
岗位要求
1、2027 届硕士及以上学历,机器学习、数据挖掘、统计学或相关专业;
2、机器学习与统计理论扎实,熟悉表示学习、聚类、主动学习与样本选择方法;
3、做过多维指标的加权评分或分级体系,能说清每一维的权重依据,并让评分结果对使用方可解释、可复算;
4、熟练使用 Python 与 PyTorch/TensorFlow,能独立完成大规模数据的特征提取、分布分析与可视化;
5、有从大规模数据中挑出高价值样本的项目或科研案例,能说清筛选策略带来的效果增益是怎么验证的;
6、具备数据工程能力,能处理非结构化高频时序数据(视频流、传感器信号),而非仅表格型数据;
7、熟练使用 Claude Code、Codex 等 AI 编码工具,熟悉 Agent 框架与工作流编排。
加分项
1、有数据价值评估、数据配比或难例挖掘方向的论文或项目;
2、有机器人学习或自动驾驶数据闭环相关的实习经历;
3、熟悉 LeRobot / RLDS 等机器人训练数据格式。