锦鲤求职

宁德时代

具身智能数据平台工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位使命

搭建从原始机器人数据到可训练数据集的完整链路,覆盖接入、校验、清洗、切分、标注、转换、版本管理、检索和交付,让模型团队获得可信、可追溯、可重复使用的训练数据。

岗位职责

1设计机器人多模态数据平台,处理视频、深度、点云、关节状态、动作、力觉、触觉和语言数据。

2建立 Raw、Validated、Curated、Training-ready 等分层数据模型和统一 Schema。

3开发分布式 ETL/ELT 流程,实现格式转换、重采样、时间对齐、Episode 切分和特征生成。

4构建数据清洗规则,识别丢帧、异常轨迹、动作越界、标定错误、传感器漂移和失败示教。

5搭建人工标注、自动标注、复核、抽检和仲裁流程,管理标签本体及标签版本。

6建立数据去重、质量打分、难例发现、主动采样和数据配比能力。

7实现数据集版本、血缘、权限、元数据、训练/验证/测试隔离及可复现快照。

8开发面向研究人员的数据浏览、轨迹可视化、语义检索和数据审计工具。

9优化存储、网络、计算和 DataLoader 吞吐,避免训练集群因数据供应不足而空转。

10将模型评测失败转化为定向筛选、重新标注和补采任务,形成数据飞轮。

任职要求

1熟练掌握 Python、SQL、NumPy/Pandas/PyArrow,具备良好的软件工程能力。4年以上数据平台、ML 数据工程、MLOps 或机器人数据处理经验。

2熟悉对象存储、关系型数据库、列式数据格式及大规模数据处理。

3熟悉 Airflow、Prefect、Ray、Spark、Kubernetes 等至少一类调度或分布式系统。

4理解视频、点云、时序信号和机器人轨迹数据的处理特点。

5有数据版本、血缘、质量监控、任务重试和幂等性设计经验。

6理解训练集污染、数据泄漏、类别/任务分布、长尾覆盖等 ML 数据问题。

7能够与机器人和模型工程师共同定义可训练数据标准。

加分项

1熟悉 LeRobot、RLDS、Open X-Embodiment 或其他机器人数据集格式。

2有 VLM 自动标注、语言 Grounding、3D 姿态或轨迹重定向经验。

3熟悉 W&B、MLflow、DVC、LakeFS、Iceberg/Delta Lake 等工具。

4有 TB/PB 级视频或多模态数据平台经验。

数据方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →