岗位描述
岗位职责
岗位介绍
面向下一代自动驾驶技术路线,打造以视觉为核心的基础模型能力。区别于传统“感知结果驱动规划”的范式,构建从图像中直接学习对驾驶动作有因果意义表征的模型体系,让 Planner 更直接地利用视觉特征完成决策,并通过端到端训练持续提升复杂场景、长尾场景和闭环驾驶表现。
团队当前重点方向包括:视觉 foundation model、泛特征建模、世界模型(World Model / World-Action Model)、几何监督、自监督学习、时序建模、场景理解,以及面向自动驾驶任务的大规模训练与迭代优化。
岗位职责
1. 负责自动驾驶基础模型的架构设计、训练与效果迭代,推动视觉泛特征在自动驾驶任务中的建模与落地;
2. 研究视觉表征学习、世界模型、未来状态预测、inverse dynamics、latent planning 等方向,并结合自动驾驶场景形成可验证的技术方案;
3. 探索 Planner 与 Vision Encoder 更深度耦合的端到端训练方式,提升模型对复杂交通参与者、长尾障碍物和开放场景的理解与决策能力;
4. 设计并验证多种辅助学习任务,包括但不限于几何监督、自监督任务、时序建模、场景理解、视觉辅助任务等,持续增强模型表征能力;
5. 负责关键实验设计、离线/闭环指标分析、问题归因和版本迭代,形成高效稳定的研发闭环;
6. 与感知、规划、数据、训练系统、工程部署等团队协同,推动研究方案向工程可落地和量产可演进方向发展。。
岗位要求
任职要求
1. 硕士及以上学历,计算机、人工智能、自动化、机器人、数学、电子工程等相关专业;
2. 具备扎实的深度学习基础,熟悉 Transformer、ViT、视频理解、时序建模、自监督学习等核心方法;
在以下一个或多个方向有较深入的研究或实战经验:
视觉基础模型 / 表征学习
世界模型
多视图几何 / 3D视觉 / 深度重建
视频理解 / 时序融合 / Future Prediction
多任务学习 / 模型蒸馏 / 量化 / 大规模训练优化
熟练使用 PyTorch 等深度学习框架,具备较强的模型实现、训练调优与问题分析能力;
具备良好的实验设计能力,能够独立完成方案验证、结果分析和方向判断;
对前沿技术保持高敏感度,能够快速理解并吸收相关论文成果,并转化为业务可落地方案;
具备较强的自驱力、沟通协作能力和工程意识。