锦鲤求职

主线科技

数据闭环算法工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

数据挖掘与标签系统方向:

岗位职责:

1. 承担数据闭环系统建设与优化任务:

- 参与自动驾驶数据闭环系统整体架构设计与核心模块开发,覆盖数据采集、清洗、筛选、标注、训练、评测、回流的全流程;

- 负责感知、预测、决策规划等任务的数据流转系统设计,实现问题 case 的自动发现、自动归因与自动分发;

- 优化大规模数据处理链路(TB~PB级),提升数据筛选、加工与回流效率;

2. 自动化标签体系设计与工具开发

- 构建面向感知(目标检测、分割、BEV、多传感器融合)、预测与规划任务的多层级标签体系(原子标签 / 组合标签 / 场景标签);

- 设计问题驱动的标签策略(Problem-driven Tagging),支撑 bad case 挖掘与专项能力提升;

- 开发自动化标签生成工具,包括:

- 基于规则引擎的自动标签生成;

- 基于模型推理结果的弱监督标签生成;

- 多模态融合标签自动对齐与一致性校验工具;

- 推动标签标准化、版本化与可追溯管理;

3. Case 自动化分析与问题挖掘:

- 构建问题 case 自动分析系统,实现:

- 误检 / 漏检 / 轨迹抖动 / 规划异常等问题的自动聚类与归因;

- 结合感知置信度、轨迹偏差、控制输出等多信号联合分析;

- 设计数据指标体系(分布偏移、长尾场景覆盖度、ODD覆盖率等),实现数据质量与模型效果联动分析;

- 建立问题 case → 标签补充 → 数据回流 → 模型优化的自动化闭环;

4. 向量化数据处理与检索系统开发

- 识别适合向量化表达的数据类型,包括:

- 图像 / BEV特征向量

- 轨迹序列 embedding

- 场景级多模态特征表示

- 规划状态空间表示

- 构建高效向量检索系统,实现:

- 相似场景检索

- 相似轨迹检索

- 长尾样本快速召回

- 参与或主导基于向量数据库(如 Pinecone、Milvus、Weaviate)的检索系统开发与性能优化;

- 支持数据主动挖掘(Active Mining)与主动学习(Active Learning)策略落地;

5. 数据挖掘与分布分析

- 设计并实现数据分布分析系统,识别训练集与真实道路数据的分布偏移(Domain Shift);

- 支持专项能力提升(如锥桶场景、施工场景、雨雾天气等)的数据专项挖掘;

- 建立基于 embedding + 聚类 的场景分群体系,提升长尾场景识别能力;

6. 工程化与平台化建设

- 参与数据平台架构设计(离线/实时链路),支持海量数据的分布式处理;

- 优化数据处理效率与存储成本,熟悉分布式计算框架(如 Apache Spark、Apache Flink);

- 构建可视化分析工具,支持算法与标注团队高效协作;

任职要求:

1. 基本要求:

- 本科及以上学历,计算机、自动化、电子信息、人工智能等相关专业;

- 3年以上自动驾驶或大规模机器学习数据平台开发经验;

- 有乘用车自动驾驶公司数据闭环系统建设深度参与经验(必备)。

2. 技术能力要求:

- 自动驾驶数据理解能力,深刻理解自动驾驶感知、预测、规划模块的数据输入输出形式。理解多传感器数据结构(Camera / LiDAR / Radar / HD Map);

- 对感知误差、规划异常、控制抖动等问题有实际问题分析经验;

- 标签体系与数据策略能力,有从0到1设计标签体系的经验,熟悉原子标签、场景标签、行为标签的层级设计,有自动标签生成工具开发经验;

- 向量化与检索系统经验,熟悉 embedding 生成方法(CNN / Transformer / BEV Encoder 等),有向量检索系统落地经验,熟悉向量数据库选型与性能优化;能独立设计相似场景召回系统;

3. 工程能力

- 精通 Python / C++,具备良好的代码工程化能力;

- 熟悉大规模数据处理与分布式系统设计;

- 熟悉常见存储系统(对象存储、列式存储等);

- 熟悉 Linux 环境与高性能计算优化;

4. 加分项

- 有端到端(E2E)自动驾驶模型数据闭环经验;

- 有主动学习(Active Learning)或数据自动筛选系统落地经验;

- 有数据指标体系(Coverage / Diversity / Risk-based mining)构建经验;

- 有分布式向量检索系统调优经验;

- 熟悉数据质量评估与数据资产管理体系。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →