岗位描述
岗位职责
1.负责面向具身智能/机器人场景的 VLM、VLA、WAM / WM 的预训练、后训练与模型迭代,构建机器人理解环境、理解指令、规划动作并执行任务的核心模型能力。
2.设计和优化视觉-语言-动作统一建模方案,包括多模态编码器、动作 Tokenizer、连续动作建模、轨迹预测、扩散策略、行为克隆、模仿学习、强化学习微调、视频/世界模型预测等方向。
3.负责机器人多源数据的建模与训练方案,包括真实机器人遥操作数据、仿真数据、视频数据、语言指令数据、轨迹数据、状态观测数据、动作序列数据等,制定数据配比、清洗、重采样、任务分布和训练 recipe。
4.建立面向具身任务的模型评测体系,包括语言指令跟随、开放词汇感知、场景理解、长时程任务成功率、泛化能力、跨场景/跨物体/跨任务/跨本体迁移能力、sim-to-real 表现等。
5.跟踪并复现前沿研究,推动关键算法在公司机器人任务中的落地。
任职要求
1.计算机、人工智能、机器人、自动化、电子工程、数学等相关专业硕士及以上学历,博士优先。
2.熟悉 PyTorch / JAX / TensorFlow 中至少一种深度学习框架,具备扎实的深度学习、多模态学习、机器人学习或强化学习基础。
3.具备以下至少一个方向的实际项目经验:
1.VLM / MLLM / LMM 多模态模型训练;
2.VLA / 机器人基础模型 / 行为模型训练;
3.视频生成/视频预测/世界模型;
4.熟悉机器人数据特点,理解 observation/action/state、轨迹、语言指令、相机图像、点云、力控/触觉等数据形式,能够设计适合机器人任务的训练样本格式和评测协议。
5.具备良好的工程实现能力,能够独立完成模型训练、实验管理、数据分析、性能诊断和代码优化。
6.有 10B+ 参数多模态模型、视频模型、机器人基础模型或大规模行为模型训练经验者优先。
7.有 NeurIPS / ICML / ICLR / CVPR / ICCV / ECCV / CoRL / RSS / ICRA / IROS 等顶会论文,或有开源大模型/机器人学习项目贡献者优先。