岗位描述
岗位职责:
1.负责或参与具身智能 Vision-Language-Action(VLA)、World Action Model(WAM)及多模态机器人基础模型的研究与开发。
2.研究视觉、语言、机器人状态、动作、力觉、触觉等多模态信息的统一表征、融合建模和时序预测方法。
3.基于机器人真实数据和人类示范数据,开展多模态预训练、行为克隆、指令微调、策略学习及跨任务泛化研究。
4.研究适用于机械臂和人形机器人的动作表示,包括关节动作、末端轨迹、关键点轨迹、Task-Space Action、Action Chunk 及接触/力相关动作表示。
5.研究基于世界模型的未来状态预测、接触事件预测、作用力预测、失败检测、任务恢复和长时序规划方法。
6.负责模型训练和评测,包括数据配比、模型结构设计、训练策略、消融实验、Scaling 分析和泛化能力评估。
7.参与构建机器人多模态数据处理与训练框架,包括数据清洗、数据筛选、轨迹对齐、模态同步、数据加载和训练基础设施。
8.推动 VLA/WAM 模型在机械臂、人形机器人和灵巧手平台上的真机部署,并与机器人运动控制、全身控制及安全系统进行集成。
9.跟踪国内外具身智能大模型、机器人世界模型和多模态学习领域的前沿进展,推动高水平论文、开源项目及实际系统成果产出。
任职要求:
1.计算机科学、人工智能、自动化、机器人、数学等相关专业。
2.正式岗位原则上要求硕士及以上学历;具有突出科研成果或工程经验者可适当放宽。实习岗位面向优秀本科高年级、硕士或博士在读学生。
3.熟练使用 Python,熟悉 PyTorch 等深度学习框架,具备良好的代码能力和实验习惯。
4.熟悉 Transformer、视觉表征学习、多模态模型、Diffusion Model、Flow Matching 或自回归模型中的一种或多种。
5.具备较好的机器学习和深度学习基础,能够独立完成模型设计、训练、调试和实验分析。
6.了解机器人模仿学习、强化学习、视觉运动策略或机器人控制中的至少一个方向。
7.对具身智能、VLA、世界模型和通用机器人策略具有浓厚兴趣,具备较强的学习和研究能力。
8.具备良好的英文论文阅读能力、沟通能力和团队协作意识。
加分项:
1.有 VLA、机器人世界模型、视觉语言模型或多模态基础模型相关研究经验。
2.有 Diffusion Policy、ACT、RT 系列、OpenVLA、π 系列或其他通用机器人策略的复现、训练或部署经验。
3.有视觉、力觉、触觉、机器人状态等多模态信息融合经验。
4.有大规模模型训练、分布式训练、模型微调、数据工程或训练加速经验。
5.有机械臂、人形机器人、移动操作机器人或灵巧手真机实验经验。
6.有机器人、机器学习、计算机视觉或人工智能领域高水平论文和开源项目经历。
7.有长时序任务、世界模型、视频预测、Action Tokenization、失败恢复或在线数据闭环相关经验。
8.熟悉 ROS/ROS 2、MuJoCo、Isaac Sim、ManiSkill 等机器人开发与仿真工具。