锦鲤求职

蔚来

AI infra研发工程师(推理系统)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
负责大模型及 AI 芯片的高性能推理系统与编译栈建设,打通从深度学习算法到芯片硬件的极致加速通路:
1. 推理系统与框架演进:参与大模型推理引擎(如 vLLM / TensorRT-LLM / SGLang 或自研引擎)的核心组件研发,优化高并发、高吞吐场景下的请求调度与缓存管理(KV Cache);
2. 计算图与编译优化:负责 AI 模型的计算图优化、算子融合(Operator Fusion)、内存复用及代码生成(Tiling/Lowering),释放硬件计算潜能;
3. 前沿技术工程落地:结合业务场景(大模型/多模态等),探索并落地投机解码、长上下文、PD 分离或模型量化压缩(FP8/INT8)等前沿优化技术;
4. 系统性能剖析与工具链:分析系统端到端瓶颈,完善性能分析(Profiling/Tracing)工具与验证体系,保障线上服务与底层工具链的高可用交付。

岗位要求
1. 计算机、人工智能、软件工程、电子通信等相关专业本科及以上学历;
2. 熟练掌握 C/C++ 或 Python,具备良好的系统编程素养与数据结构基础;
3. 理解主流深度学习模型的计算原理(如 Transformer、CNN 等),熟悉模型推理的基本计算流程与内存瓶颈;
4. 具备扎实的工程实现与性能分析能力,对软硬件协同优化有浓厚兴趣。
满足以下条件优先
1. 熟悉至少一种主流推理框架(如 vLLM、TensorRT-LLM、SGLang、Triton Server 等),对其底层调度、PagedAttention、PD 分离等机制有实践经验;
2. 熟悉 TVM、MLIR、TensorRT、Torch-Inductor、IREE、XLA 等深度学习编译器,有图优化 Pass、算子融合或 Tiling 优化实战经验;
3. 具备 GPU/NPU 异构加速实战经验,熟悉 CUDA/Triton 编程,或有 AWQ、GPTQ、SmoothQuant 等低比特量化(INT8/FP8/INT4)加速落地经验;
4. 有智能辅助驾驶、具身智能、音视频图像等领域的模型工程化落地与部署经验;
5. 在相关开源社区(如 vLLM、TensorRT-LLM、TVM 等)有代码贡献,或在体系结构、系统优化相关顶会发表过论文。

半导体/芯片方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →