岗位描述
岗位职责
VLA 模型研发:负责端到端自动驾驶 Vision-Language-Action(VLA)大模型的设计、训练与迭代,打通感知—理解—决策—控制全链路,输出可落地的驾驶行为策略。
多模态融合:融合视觉(多路环视/前视相机)、激光雷达、导航地图与自然语言指令等多模态输入,构建统一的场景理解与推理能力。
模型架构优化:探索并优化 VLM/VLA 基座架构(如 ViT、Q-Former、LLM decoder、Diffusion/Autoregressive action head 等),提升长尾场景下的泛化与推理能力。
数据闭环:参与数据采集、自动标注、难例挖掘与数据配比设计,构建高质量的 SFT / RLHF / 模仿学习训练数据闭环。
训练与推理部署:负责大规模分布式训练(多机多卡),以及模型量化、蒸馏、剪枝,推动模型在车端算力平台(Orin / Thor 等)上的实时高效部署。
评测与仿真:搭建开环/闭环评测体系,结合仿真环境验证模型安全性、可靠性与可解释性。
任职要求
基本要求
计算机、自动化、人工智能、电子工程等相关专业,硕士及以上学历。
扎实的深度学习基础,熟练掌握 PyTorch,熟悉 Transformer、扩散模型等主流架构。
熟悉多模态大模型(VLM/VLA)或端到端自动驾驶技术栈,有相关项目/论文/竞赛经验。
加分项
有 VLA、端到端自动驾驶(如 UniAD、VAD、DriveVLM 等方向)或具身智能相关研发经验。
在 CVPR / ICCV / NeurIPS / ICLR / CoRL 等顶会发表过相关论文。
有大规模模型训练(LLM/多模态)、RLHF、模型压缩与车端部署实战经验。
熟悉 CUDA、分布式训练框架(DeepSpeed / Megatron / FSDP)及推理加速(TensorRT)