岗位描述
岗位职责
1.负责图像、视频及机器人轨迹数据的清洗、标注、质量评估和训练数据构建,重点覆盖空间关系、物体交互、动作与任务过程。
2.参与具身智能领域视觉语言模型(VLM)的预训练、继续预训练和 SFT,优化数据配比与训练策略。
3.建立模型评测与迭代闭环,提升空间理解、时序推理和机器人任务泛化能力。
岗位要求
1.有多模态大模型的实际训练经验,熟悉 PyTorch 及分布式训练。
2.理解图文、视频与机器人数据的表示和对齐;能独立完成从数据构建到训练、评测的关键工作。
3.能清楚说明自己负责的训练任务、数据规模、实验设计和效果提升。
优先考虑
1.有机器人、具身智能、VLM、模仿学习或动作数据训练经验的候选人。