岗位描述
岗位职责
岗位职责
负责大模型推理服务的车端部署、上线,保障服务的高可用、低延迟与稳定性;
构建和优化推理框架,提升吞吐、降低时延与显存占用;
参与模型量化、压缩、KV Cache 优化等推理加速工作,推动硬件资源的高效利用;
与算法、模型团队紧密协作,推动模型从训练到生产环境的高效落地;
跟进业界推理优化与部署前沿技术,并在生产环境中落地实践。
岗位要求
基本要求
计算机、软件工程、人工智能等相关专业本科及以上学历;
熟练掌握 PyTorch熟悉 C++/CUDA 者优先;
熟悉主流推理框架(vLLM、SGLang、TensorRT-LLM 等)及其部署优化;
熟悉模型量化/压缩技术(GPTQ、AWQ、SmoothQuant、FP8 等);
加分项
熟悉 CUDA 编程、算子优化或 Triton 开发;
熟悉模型剪枝,蒸馏等技术
有推理成本优化、性能压测或可观测性体系建设经验;
对 LLM 推理底层原理(Attention、KV Cache、PagedAttention 等)有深入理解。