岗位描述
职位描述:
1)负责具身智能 Vision-Language-Action(VLA)、World Action Model(WAM)及多模态机器人基础模型的研究与开发;
2)研究视觉、语言、机器人状态、动作、力觉、触觉等多模态信息的统一表征、融合建模与时序预测方法;
3)基于机器人数据和人类示范数据,开展多模态预训练、模仿学习、策略学习及跨任务、跨场景泛化研究;
4)负责模型架构设计、训练与评测,包括数据配比、训练策略、消融实验、Scaling Law 和泛化能力分析;
5)跟踪具身智能大模型、机器人世界模型和通用机器人策略等前沿进展,推动高水平论文、开源模型及科研成果产出。
任职要求:
1)计算机、人工智能、自动化、机器人、数学等相关专业,硕士及以上学历;
2)熟练使用 Python 和 PyTorch,具备扎实的机器学习、深度学习基础和良好的代码能力;
3)熟悉 Transformer、多模态模型、Diffusion Model、Flow Matching、自回归模型中的一种或多种;
4)了解机器人模仿学习、VLA、世界模型、视觉运动策略或强化学习中的至少一个方向;
5)具备独立阅读论文、复现算法、设计实验和分析结果的能力;
6)具备良好的英文阅读与写作能力,以及良好的沟通和团队协作意识。
加分项:
1. 有 VLA、机器人世界模型、多模态基础模型或通用机器人策略相关研究经验;
2. 有 Diffusion Policy、ACT、OpenVLA、π 系列等模型的复现、训练或改进经验;
3. 有视觉、动作、力觉、触觉或机器人状态等多模态建模经验;
4. 有大模型预训练、分布式训练、数据筛选、数据混合或 Scaling Law 研究经验;
5. 在机器人、机器学习、计算机视觉或人工智能领域发表过高水平论文,或有较有影响力的开源项目。