岗位描述
岗位职责(具体工作内容)
1. 核心参与自动驾驶世界模型、多模态大模型、感知大模型的研发、迭代与落地,聚焦自动驾驶场景端到端感知、场景理解、环境建模等核心模块,支撑智能驾驶高阶智能能力升级。
2. 负责自动驾驶多模态数据(图像、点云、雷达、语义文本等)的融合处理、数据集构建、清洗优化与质量迭代,支撑多模态大模型、感知大模型的训练与微调工作。
3. 开展自动驾驶感知大模型、多模态大模型的模型训练、参数调优、消融实验、性能评测,针对性优化模型感知精度、场景泛化能力、推理速度与鲁棒性,适配复杂路况场景。
4. 参与自动驾驶世界模型的场景建模、环境预测、动态场景推演算法研发,依托大模型能力实现自动驾驶场景实时理解、态势感知、未来状态预判,赋能决策规划模块。
5. 结合仿真平台与实车场景,完成大模型算法的测试、问题复现与缺陷优化,落地模型轻量化、推理加速方案,保障大模型算法在车端场景的可行性与稳定性。
6. 跟进自动驾驶世界模型、多模态感知大模型领域前沿论文与开源方案,完成算法复刻、改进与创新迭代,输出标准化实验报告与技术文档。
任职资格(学历、目标院校、语言、技能、性格等要求)
基础硬性条件
1. 硕士及以上学历,计算机、自动化、车辆工程、人工智能、软件工程、数学、电子信息等相关专业,2026-2028届毕业生优先。
2. 扎实的深度学习、大模型基础、多模态学习、计算机视觉、概率论、线性代数核心知识,熟悉大模型预训练、微调、对齐、特征融合核心原理。
3. 熟练掌握Python编程,熟练使用PyTorch框架,熟悉大模型训练、微调工具链,具备多模态模型开发落地经验优先。
4. 熟悉Linux开发环境,掌握Git、Shell等常用开发工具,具备规范的代码编写与管理习惯。
核心专项能力(满足其一即可)
自动驾驶感知大模型方向:熟悉自动驾驶端到端感知大模型、视觉感知模型研发,掌握图像/点云特征提取、语义分割、目标感知、场景理解技术,了解大模型在自动驾驶感知任务的落地范式。
多模态大模型方向:熟悉多模态融合技术,掌握图文、点云-图像、雷达-视觉多模态特征对齐与融合算法,了解多模态大模型预训练、SFT微调、模态对齐方案,有相关模型研发经验优先。
自动驾驶世界模型方向:了解自动驾驶世界模型、场景生成、动态场景推演、环境建模核心思路,熟悉基于大模型的场景预测、态势感知、仿真建模技术,有相关项目研究经验优先。
加分项
1. 有自动驾驶大模型、多模态大模型、世界模型、端到端自动驾驶算法相关科研项目、实习或竞赛经历。
2. 熟悉LLaMA、CLIP、SAM、BEV、端到端自动驾驶大模型等相关开源模型,掌握大模型微调、量化、轻量化、部署优化技术。
3. 有CARLA仿真场景建模、自动驾驶数据集构建、多模态模型融合训练、车端大模型推理优化经验。
4. 在多模态、计算机视觉、自动驾驶领域有顶会论文、算法竞赛获奖、开源项目贡献者优先。
注:若有其他疑问 可邮件咨询internrecruit@didiglobal.com