岗位描述
工作内容
1、世界模型架构设计与实现。负责机器人场景下的世界模型架构设计与训练,探索并融合视频扩散生成模型(Video Diffusion Model)与联合嵌入预测架构(JEPA)等技术路线。设计高效的世界状态表征,使模型不仅能生成高保真视频,更能理解物体恒存性、三维几何关系与物理因果逻辑。
2、视频生成模型训练与优化。主导面向机器人操作、导航等场景的视频生成模型全流程训练,包括大规模数据预处理、多卡并行训练框架搭建、显存优化、训练稳定性与收敛性调优。攻克长时序视频生成中的一致性问题,使生成结果严格遵循物理定律(如刚体运动、流体、碰撞、重力等)。
3、机器人任务对齐与工程落地。将世界模型与机器人具体任务(如抓取、推拉、避障)深度结合,利用模型进行任务规划、数据增广与Sim-to-Real迁移。解决模型在真实机器人场景中的实时性、鲁棒性挑战,完成端到端的算法工程化与部署验证。
4、前沿技术追踪与团队建设。跟踪 NeurIPS/ICLR/CVPR/RSS/CoRL 等顶会最新成果,保持技术视野的前沿性。作为核心技术骨干,参与制定技术路线图,并指导初级工程师进行模块开发等。
任职条件
1、博士学历,计算机、自动化、数学、物理等相关专业;
2、扎实的机器学习与深度学习理论基础,深刻理解扩散模型、生成对抗网络或自监督学习等生成式模型原理;
3、核心能力(二选一必备,兼有者优先)
方向A-生成模型专长: 有大规模视频/图像扩散模型的训练经验,亲手处理过数据清洗、分布式训练、模型并行、推理加速等完整链路,对视频生成中的物理合理性、时序一致性有深入思考。
方向B-世界模型专长: 对JEPA、世界模型、模型-based RL有深入研究,在状态表征学习、视频预测、物理场景理解等方向有代表性工作,并对模型如何落地机器人有强烈兴趣。
4、学术与工程成果。
在人工智能顶会(CVPR, ICCV, ECCV, NeurIPS, ICML, ICLR, RSS, CoRL等)或顶刊(TPAMI, IJCV等)上发表过至少一篇一作/共一论文。
有完整的从研究想法到工程验证的闭环经验,代码能力强,熟悉PyTorch等主流框架,能独立进行复杂系统的开发与调试。有CUDA编程或模型推理部署经验者优先。