岗位描述
【工作职责】
1. 负责大模型推理部署框架的设计和研发,优化大模型的端到端延时和性能开销,构建业界领先的车载大模型推理能力;
2. 负责多模态VLM/VLA模型在车载AI芯片平台上的全链路优化与部署,支撑核心功能的量产落地;
3. 定位和分析性能瓶颈,通过软硬件协同设计,与算法团队合作改进模型架构,提高计算效率和功能体验。
【任职要求】
1. 具备大模型推理部署及优化开发经验,精通至少一种大模型推理引擎,如MLC-LLM/TensorRT-LLM/vLLM/llamacpp等;
2. 熟悉大模型推理优化技术,如压缩量化、计算并行、算子融合、投机采样、缓存管理等;
3. 熟悉芯片体系架构,具有CPU、CUDA、NPU、DSP等平台的高性能计算优化经验,掌握相应的编程接口、性能分析工具和调优方法;
4. 精通C++/Python编程语言,具备良好的代码书写规范和文档编写能力;
5. 具备良好的问题分析及沟通能力,能够与跨职能团队高效协作;
6. 本科5年、硕士3年以上工作经验,熟悉计算机体系结构,熟悉深度学习算法原理和主流AI框架。
优先条件
1. 有基于英伟达平台的大模型部署优化经验及CUDA开发和调优经验者优先;
2. 熟练掌握深度学习编译优化技术,有基于MLC-LLM/TVM等开源编译器的开发经验者优先;
3. 在大模型推理加速领域有研究,发表过相关领域的高水平论文或参与过开源社区贡献者优先。