岗位描述
岗位使命
搭建从原始机器人数据到可训练数据集的完整链路,覆盖接入、校验、清洗、切分、标注、转换、版本管理、检索和交付,让模型团队获得可信、可追溯、可重复使用的训练数据。
岗位职责
1设计机器人多模态数据平台,处理视频、深度、点云、关节状态、动作、力觉、触觉和语言数据。
2建立 Raw、Validated、Curated、Training-ready 等分层数据模型和统一 Schema。
3开发分布式 ETL/ELT 流程,实现格式转换、重采样、时间对齐、Episode 切分和特征生成。
4构建数据清洗规则,识别丢帧、异常轨迹、动作越界、标定错误、传感器漂移和失败示教。
5搭建人工标注、自动标注、复核、抽检和仲裁流程,管理标签本体及标签版本。
6建立数据去重、质量打分、难例发现、主动采样和数据配比能力。
7实现数据集版本、血缘、权限、元数据、训练/验证/测试隔离及可复现快照。
8开发面向研究人员的数据浏览、轨迹可视化、语义检索和数据审计工具。
9优化存储、网络、计算和 DataLoader 吞吐,避免训练集群因数据供应不足而空转。
10将模型评测失败转化为定向筛选、重新标注和补采任务,形成数据飞轮。
任职要求
1熟练掌握 Python、SQL、NumPy/Pandas/PyArrow,具备良好的软件工程能力。4年以上数据平台、ML 数据工程、MLOps 或机器人数据处理经验。
2熟悉对象存储、关系型数据库、列式数据格式及大规模数据处理。
3熟悉 Airflow、Prefect、Ray、Spark、Kubernetes 等至少一类调度或分布式系统。
4理解视频、点云、时序信号和机器人轨迹数据的处理特点。
5有数据版本、血缘、质量监控、任务重试和幂等性设计经验。
6理解训练集污染、数据泄漏、类别/任务分布、长尾覆盖等 ML 数据问题。
7能够与机器人和模型工程师共同定义可训练数据标准。
加分项
1熟悉 LeRobot、RLDS、Open X-Embodiment 或其他机器人数据集格式。
2有 VLM 自动标注、语言 Grounding、3D 姿态或轨迹重定向经验。
3熟悉 W&B、MLflow、DVC、LakeFS、Iceberg/Delta Lake 等工具。
4有 TB/PB 级视频或多模态数据平台经验。