岗位描述
工作内容
1. 推理引擎模块设计与开发:参与大模型推理引擎的核心模块设计及开发,协同架构师完成技术方案落地,支撑千卡级AI算力集群的稳定运行。
2. 推理引擎构建:负责推理引擎核心功能的开发与优化,深入研究KVCache管理、量化推理、投机采样、PD分离等关键技术,推动低延迟、高并发推理方案在百炼平台的产品化落地。有大模型训练经验优先,有RLHF、GRPO、DAPO等强化学习经验优先。
3. 软硬协同与性能调优:通过CUDA/Triton算子开发、编译优化等手段挖掘硬件算力,参与昇腾等国产硬件的适配与性能调优工作;负责推理全链路稳定性与可观测性体系建设,保障服务SLA。
4. 技术攻坚与团队协作:跟踪AI系统领域前沿技术,主导或参与关键技术难点攻关,指导初级工程师,与算法、产品等跨域团队高效协同。
任职条件
1.本科及以上学历,并取得相应学位,计算机及相关专业优先
2. 8年以上AI基础设施、高性能计算或分布式系统开发经验,其中至少2年大模型推理引擎的研发与性能调优经验。
3. 精通Python/C++/Go中至少一种编程语言,精通vLLM/SGLang/TensorRT-LLM等推理引擎的内核实现,对KVCache、PagedAttention、Prefix Caching等关键技术有深度实战经验。
4. 精通CUDA编程,熟悉NCCL/RDMA高性能网络,熟悉XLA/MLIR编译优化者优先。
5. 具备独立完成复杂系统模块设计与开发的能力,有良好的性能分析与问题定位能力,能带领小团队完成技术攻关。
6. 加分项:熟悉昇腾910B/910C及华为CANN异构计算栈;有RLHF全流程训练系统的工程落地经验;有大规模在线推理服务(日请求百万级)的架构与运维经验。
7.诚实守信、作风踏实严谨、责任心强;具备良好团队协作能力精神;学习能力强,善于解决复杂问题。