岗位描述
工作内容
1、大模型推理容器化调度:负责设计并实现海量异构NPU/GPU资源的容器化调度与算力池化,支持PD分离、多角色混合部署、弹性资源混布与潮汐拆借,优化集群整体资源利用率。
2、推理性能优化与调度协同:结合PD分图、EP调度、KV Cache感知调度等技术,设计调度器与推理引擎(如vLLM)的联动机制,实现长序列场景下的负载均衡,提升系统QPS与Token生成吞吐量。
3、算子级与推理框架优化:支持算子入图、异步调度、计算-通信重叠等优化手段,推动稀疏注意力、量化(INT4/INT8/FP8)等算法在容器环境中的落地,降低推理时延(TTFT/TPOT),提升硬件利用率。
4、稳定性与自愈能力:设计多级容错机制,实现推理服务的快速故障隔离与自动恢复,保障SLA达标。
任职条件
1、大学本科及以上学历,并取得相应学位,计算机及相关专业优先;
2、8年及以上工作经验,云深入理解 Kubernetes 架构与生态,熟悉 Docker/Containerd/Kata 等容器运行时,有实际的大模型服务容器化与编排经验;
3、编程能力:熟练掌握Linux环境下的 Go/Python/C++ 中至少两种语言,具备良好的工程化与文档习惯;
推理框架经验:熟悉至少一种主流推理框架(vLLM、SGLang 等),理解其调度、显存管理、请求合并等机制。
4、性能优化实践:有实际的大模型推理性能优化经验,包括但不限于:异步调度、算子入图、计算-通信重叠、前缀感知负载均衡、稀疏注意力优化等。
5、硬件体系理解:了解 GPU(NVIDIA/AMD) 或 NPU(昇腾等) 体系结构,能够使用Profiling工具(如Nsight、MindStudio)定位性能瓶颈。
6、分布式系统能力:掌握分布式系统核心原理(容错、一致性、扩缩容、负载均衡),有大规模集群(5000+节点)实践经验者优先。
加分项:
1、有 Ascend C 或 CUDA 算子开发经验,尤其是Attention类算子优化。
2、在 ICLR/OSDI/NSDI/FAST 等顶会发表过推理或调度相关论文。
3、有 LLM推理服务 从0到1的容器化上云经验,包括日志、监控、弹性、灰度等。