岗位描述
工作内容
1. 负责大模型token推理服务的生产环境运维:vLLM/SGLang/MindIE等推理引擎的部署、升级、扩缩容与7×24小时稳定性保障,参与Oncall值班。
2. 负责推理服务的生产级性能优化:围绕TTFT、TPOT、吞吐(tokens/s)、并发、排队时长等核心指标,开展引擎参数调优、KV Cache与批处理策略优化,配合PD分离架构落地,持续提升单卡产出。
3. 负责推理业务故障的分诊与处置:处理生产环境性能与可用性问题,推动重大故障复盘、问题归因和系统性改进,降低 MTTR 和重复故障率。
4. 建立模型全生命周期运维能力:模型权重的高效分发与快速加载(数百GB级)、模型版本管理、灰度发布与快速回滚、多模型混部与资源隔离。
5. 负责推理服务弹性能力建设:基于流量与队列指标的自动扩缩容、多副本/多集群流量调度、限流降级与过载保护。
6. 建设推理业务监控与自动化运维:搭建GPU层、引擎层、请求层(token粒度)指标体系与告警能力,探索基于大模型 Agent 的运维自动化,包括日志分析、故障诊断、操作建议和变更风险评估。
7. 沉淀runbook与自动化工具,将成熟的运维操作标准化并移交业务运维团队执行。
任职条件
1.本科及以上学历,并取得相应学位,计算机及相关专业优先。
2. 8年以上运维/SRE/基础架构经验,其中3年以上大模型推理服务生产环境运维或支持经验。
3. 理解大模型推理关键性能指标(TTFT/TPOT/吞吐)及其影响因素,有实际的生产性能优化或疑难问题排查案例,熟悉Kubernetes及GPU调度,熟练使用Python/Shell开发自动化工具,熟悉Prometheus/Grafana/OpenTelemetry等可观测技术体系。
4. 熟悉至少一种主流推理引擎(vLLM/SGLang/MindIE)的生产部署与调优,理解continuous batching、paged attention、KV Cache管理、量化等核心机制。
5. 熟悉GPU使用与常见问题(CUDA、显存OOM、NCCL通信、Xid错误等),具备GPU环境问题定位能力;有多机多卡推理(TP/PP并行)运维经验者优先。
6. 有推理网关、流量调度、基于自定义指标的弹性伸缩(KEDA/HPA)、智能运维、异常检测或运维 Agent 项目经验者优先。
7.诚实守信、作风踏实严谨、责任心强;具备良好团队协作能力精神;学习能力强,善于解决复杂问题。