岗位描述
工作内容
1. 负责大模型推理服务底层能力研发,建设和优化基于 Kubernetes 的模型部署、运行、调度及弹性伸缩体系。
2. 负责模型服务智能扩缩容体系建设,结合业务负载、SLO、模型容量及资源情况,实现容量评估、弹性决策、流量调度及扩缩容闭环。
3. 负责大模型推理性能与部署效率优化,包括模型冷启动、权重分发、KV Cache、PD 分离、请求调度等关键技术。
4. 负责模型服务高可用及可观测体系建设,保障模型部署、扩缩容和运行过程稳定、可观测、可恢复。
5. 跟踪并研究 vLLM、AIBrix、Kubernetes、Volcano、KEDA 等云原生及 AI Infra 技术,推动相关技术在生产环境落地及开源社区贡献。
任职条件
1. 本科及以上学历,并取得相应学位,计算机及相关专业优先
2. 8年以上工作就经验,熟练掌握 Go / Python 等至少一种开发语言,具备复杂分布式系统设计、开发和问题排查能力。
3. 具备扎实的 Kubernetes / 云原生研发经验,熟悉 Controller / Operator、调度、网络、存储及服务治理等核心机制。
4. 熟悉 GPU / NPU 等异构算力环境,了解 CUDA、Ascend 或相关加速生态及资源调度机制。
5. 熟悉大模型推理技术栈,了解 vLLM、SGLang、MindIE-Motor 等至少一种推理框架;对 PD 分离、KV Cache、Prefix Cache、Continuous Batching 等机制有较深入理解。
6. 具备性能分析和系统优化能力,能够围绕 TTFT、TPOT、吞吐、并发、资源利用率等指标进行容量评估和性能优化。
7. 有大规模 Kubernetes 集群、AI 推理平台、模型服务平台或智能调度系统实际研发经验者优先;有 Kubernetes / AIBrix / vLLM 等开源社区贡献经验者优先。
8.诚实守信、作风踏实严谨、责任心强,具备良好团队协作能力精神,学习能力强,善于解决复杂问题。