锦鲤求职

极智嘉

VLA数据开发实习生

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

【岗位职责】

1.多模态数据标准化与清洗:

负责具身智能场景下多源异构数据(视觉RGB-D、点云、自然语言指令、机器人动作轨迹等)的格式转换与标准化工作。

参与构建统一的数据表示与存储规范,打通真机采集、仿真生成及开源数据集(如Open X-Embodiment)之间的格式壁垒。

2.数据质量提升Pipeline开发:

协助设计并开发大规模数据的自动化清洗流程,包括异常检测、去噪、时序对齐、数据去重及样本均衡等算法实现。

致力于提升训练数据的“净度”,降低脏数据对VLA模型预训练及微调的负面影响。

3.数据-模型闭环优化(Data-Centric AI):

深入理解VLA模型架构,协助建立数据质量评估与模型效果反馈的闭环机制。

基于模型训练过程中的Bad Case(失败案例),反向分析数据分布问题,设计相应的数据增强或过滤策略,驱动模型迭代。

4.工具链建设与工程化:

参与数据清洗与预训练工具链的建设,推动清洗规则及预处理Pipeline的工程化与自动化,提升整体数据准备的人效。

【任职要求】

1.学历背景:计算机科学、人工智能、机器人、自动化等相关专业,硕士及以上学历在读(优秀本科生亦可)。

编程与框架:

2.精通Python,熟悉PyTorch等深度学习框架,具备良好的代码规范和工程落地能力。

熟悉常见的数据处理库(Pandas, NumPy)及大数据处理工具。

3.领域认知:

对具身智能(Embodied AI)、自动驾驶或人形机器人领域有浓厚兴趣。

了解VLA (Vision-Language-Action) 模型的基本架构与训练范式,理解数据在其中的核心作用。

4.数据Sense:

具备良好的数据敏感度,能分析数据分布对模型训练的影响。

有处理过百万级以上大规模数据集的经验,熟悉数据清洗、增强、采样等方法者优先。

【加分项】

1.有LeRobot、Open X-Embodiment等知名具身智能数据集的清洗或预训练实践经验。

2.在VLA、RT-X、ACT、Diffusion Policy等具身模型上有过数据侧的优化经历。

3.有从0到1构建数据清洗Pipeline或数据预训练框架的完整项目经历。

4.熟悉多模态数据(图像、点云、文本、动作序列)的融合处理方法。

5.在CVPR/ICRA/CoRL/NeurIPS等顶会有相关论文发表或开源项目贡献。

6.了解机器人运动学基础(FK/IK, SE3变换)。

7.熟悉OpenCV或3D视觉库(Open3D),能理解点云与RGB图像的映射关系。

数据方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →