岗位描述
岗位职责:
1、优化高性能LLM推理引擎,优化LLM模型在多种硬件平台的推理性能,实现低延迟、高吞吐的工业级部署。
2、开发CUDA/Triton算子、分布式推理策略优化、量化/稀疏化等模型加速优化等。
3、与算法团队协作,推动大模型算法与推理框架的深度融合,提升整体系统效率。
4、跟踪业界最新的大模型优化技术和推理框架,持续改进优化效果。
岗位要求:
1、熟练掌握C++/Python,熟练使用PyTorch深度学习框架,有良好的算法和数据结构基础。
2、熟悉CUDA编程,有Triton/CUTLASS等开发经验优先。
3、有vLLM、Sglang、TensorRT-LLM等开源推理框架实际开发经验。
4、熟悉GPU集群通信架构,深入理解卡间通信(NVLink/PCIe)及机间通信(RDMA/RoCE),理解NCCL、HCCL等通信库的工作机制。
5、有技术好奇心和快速学习能力,出色的沟通协调能力和团队协作精神。