岗位描述
职位描述
负责具身智能机器人多模态操作模型算法研发,重点研究视觉、语言、动作、空间等多模态信息的融合与统一表征,包括但不限于:多模态表征学习、跨模态对齐与融合、视觉语言模型、时空与空间表征学习等;
负责多模态操作模型的训练与优化,研究不同模态之间的联合建模、特征交互与信息融合机制,提升模型对真实物理世界的理解、推理与泛化能力;
探索多模态表征在具身智能任务中的应用,包括机器人场景理解、空间推理、行为理解与生成等,并推动相关算法在真实机器人系统中的验证与落地。
职位要求
计算机、电子工程、人工智能、机器人等相关专业硕士以上学历;
在校期间有多模态学习、表征学习、视觉语言模型、计算机视觉或机器人学习等相关研究或算法开发经验,熟悉深度学习模型训练与实验方法;
对至少一个相关方向具有深入理解和研究成果,包括但不限于:Multimodal Learning、Representation Learning、VLM、跨模态对齐、视频理解、3D/4D表征学习、生成模型等;
熟练掌握Python和C++,熟悉PyTorch等深度学习框架,具备良好的算法实现、实验分析与工程能力。
注:
本岗位在北京招聘人数最多,为应届岗位,面向2026年9月1日-2027年12月31日毕业的应届同学。若您是社招简历,请至社招官网投递同岗位,谢谢。