岗位描述
岗位职责
1. 大模型推理全链路优化,通过量化、剪枝、KV Cache等技术提升吞吐、降低延迟、降本增效
2. 深耕vLLM、TensorRT-LLM等推理框架,二次开发与定制优化
3. GPU异构计算优化,运用CUDA编程、Tensor Core加速,解决算力利用率低、内存碎片化
4. 协同算法工程团队推动推理系统工程化,参与分布式推理部署,保障P99延迟、吞吐达标
5. 跟踪推测解码、动态批处理等前沿技术并落地
岗位要求
1. 本科及以上,计算机/电子/AI相关专业,有大模型推理加速/高性能计算经验,千亿级优化经验优先
2. 精通C++/Python,熟悉PyTorch,能独立完成推理优化开发调试优先
3. 熟悉NVIDIA GPU架构与CUDA生态,掌握CUDA Kernel/TensorRT,会用Nsight定位瓶颈
4. 深入理解Transformer推理流程,熟练使用至少一种主流推理框架,熟悉量化/剪枝/蒸馏
5. 有分布式推理部署、GPU集群优化或开源框架贡献经验者优先