岗位描述
数据挖掘与标签系统方向:
岗位职责:
1. 承担数据闭环系统建设与优化任务:
- 参与自动驾驶数据闭环系统整体架构设计与核心模块开发,覆盖数据采集、清洗、筛选、标注、训练、评测、回流的全流程;
- 负责感知、预测、决策规划等任务的数据流转系统设计,实现问题 case 的自动发现、自动归因与自动分发;
- 优化大规模数据处理链路(TB~PB级),提升数据筛选、加工与回流效率;
2. 自动化标签体系设计与工具开发
- 构建面向感知(目标检测、分割、BEV、多传感器融合)、预测与规划任务的多层级标签体系(原子标签 / 组合标签 / 场景标签);
- 设计问题驱动的标签策略(Problem-driven Tagging),支撑 bad case 挖掘与专项能力提升;
- 开发自动化标签生成工具,包括:
- 基于规则引擎的自动标签生成;
- 基于模型推理结果的弱监督标签生成;
- 多模态融合标签自动对齐与一致性校验工具;
- 推动标签标准化、版本化与可追溯管理;
3. Case 自动化分析与问题挖掘:
- 构建问题 case 自动分析系统,实现:
- 误检 / 漏检 / 轨迹抖动 / 规划异常等问题的自动聚类与归因;
- 结合感知置信度、轨迹偏差、控制输出等多信号联合分析;
- 设计数据指标体系(分布偏移、长尾场景覆盖度、ODD覆盖率等),实现数据质量与模型效果联动分析;
- 建立问题 case → 标签补充 → 数据回流 → 模型优化的自动化闭环;
4. 向量化数据处理与检索系统开发
- 识别适合向量化表达的数据类型,包括:
- 图像 / BEV特征向量
- 轨迹序列 embedding
- 场景级多模态特征表示
- 规划状态空间表示
- 构建高效向量检索系统,实现:
- 相似场景检索
- 相似轨迹检索
- 长尾样本快速召回
- 参与或主导基于向量数据库(如 Pinecone、Milvus、Weaviate)的检索系统开发与性能优化;
- 支持数据主动挖掘(Active Mining)与主动学习(Active Learning)策略落地;
5. 数据挖掘与分布分析
- 设计并实现数据分布分析系统,识别训练集与真实道路数据的分布偏移(Domain Shift);
- 支持专项能力提升(如锥桶场景、施工场景、雨雾天气等)的数据专项挖掘;
- 建立基于 embedding + 聚类 的场景分群体系,提升长尾场景识别能力;
6. 工程化与平台化建设
- 参与数据平台架构设计(离线/实时链路),支持海量数据的分布式处理;
- 优化数据处理效率与存储成本,熟悉分布式计算框架(如 Apache Spark、Apache Flink);
- 构建可视化分析工具,支持算法与标注团队高效协作;
任职要求:
1. 基本要求:
- 本科及以上学历,计算机、自动化、电子信息、人工智能等相关专业;
- 3年以上自动驾驶或大规模机器学习数据平台开发经验;
- 有乘用车自动驾驶公司数据闭环系统建设深度参与经验(必备)。
2. 技术能力要求:
- 自动驾驶数据理解能力,深刻理解自动驾驶感知、预测、规划模块的数据输入输出形式。理解多传感器数据结构(Camera / LiDAR / Radar / HD Map);
- 对感知误差、规划异常、控制抖动等问题有实际问题分析经验;
- 标签体系与数据策略能力,有从0到1设计标签体系的经验,熟悉原子标签、场景标签、行为标签的层级设计,有自动标签生成工具开发经验;
- 向量化与检索系统经验,熟悉 embedding 生成方法(CNN / Transformer / BEV Encoder 等),有向量检索系统落地经验,熟悉向量数据库选型与性能优化;能独立设计相似场景召回系统;
3. 工程能力
- 精通 Python / C++,具备良好的代码工程化能力;
- 熟悉大规模数据处理与分布式系统设计;
- 熟悉常见存储系统(对象存储、列式存储等);
- 熟悉 Linux 环境与高性能计算优化;
4. 加分项
- 有端到端(E2E)自动驾驶模型数据闭环经验;
- 有主动学习(Active Learning)或数据自动筛选系统落地经验;
- 有数据指标体系(Coverage / Diversity / Risk-based mining)构建经验;
- 有分布式向量检索系统调优经验;
- 熟悉数据质量评估与数据资产管理体系。