岗位描述
工作内容
岗位核心价值
负责公司大规模 AI 算力平台、调度平台及分布式训练平台的架构设计、建设落地、运维优化与能力迭代,支撑大模型训练、推理服务、自动驾驶模型训练等核心业务高效稳定运行。基于 Kubernetes、Volcano / Slurm、Kubeflow / Ray、PyTorch 等技术体系,打造高可用、高弹性、高资源利用率、易用稳定的智能算力基础设施平台。
核心工作职责
1. 算力平台与 PaaS 平台建设: 主导或参与 AI 算力平台、容器平台、PaaS 平台的架构设计与建设,包括集群管理、资源池化、配额管理、任务管理、镜像管理、权限管控等核心能力建设,提升平台易用性与稳定性。
2. 调度系统设计与优化: 负责 Kubernetes / Volcano / Slurm / Kueue / Ray 等调度或编排系统的搭建、优化与二次开发,围绕 GPU 资源调度、队列管理、优先级、抢占、Gang Scheduling、弹性调度、拓扑感知调度等场景进行优化,提高集群资源利用率与任务吞吐能力。
3. AI 任务与分布式训练平台能力建设: 面向大模型训练、推理、数据处理等场景,建设任务提交、任务编排、生命周期管理、日志查询、资源监控、失败重试、断点续训、Checkpoint 管理、任务诊断等平台能力,提升算法团队和客户的使用效率。
4. 训练框架适配与集成: 负责 PyTorch、TensorFlow、Megatron-LM、DeepSpeed、FSDP、Horovod、Ray Train 等训练框架在算力平台上的适配与集成,提升分布式训练任务的接入效率、运行稳定性和平台兼容性。
5. 资源管理与成本优化: 负责 GPU / CPU / 存储 / 网络等资源的统一管理与容量规划,建设资源画像、利用率分析、资源回收、闲置治理、成本统计等能力,推动算力资源高效利用。
6. 国产 GPU 与异构算力适配: 参与国产 GPU / AI 加速卡在算力平台和训练平台中的适配工作,包括驱动环境、容器镜像、训练框架、算子兼容、模型迁移、性能调优等,推动国产算力在客户训练场景中的落地。
任职条件
核心技能
1. 5 年以上 AI Infra / 云原生平台 / 机器学习平台 / 后端工程 / 基础架构相关经验,具备 3 年以上 Kubernetes、AI 平台、PaaS 平台、算力调度平台或分布式训练平台建设经验。
2. 熟悉 Kubernetes 基础能力,理解 Pod、Job、CRD、Operator、镜像、存储挂载、资源配额、调度策略等机制,具备容器化任务排查和平台集成经验。
3. 熟悉 AI 算力调度系统,有 Volcano / Slurm / Kueue / Ray / YARN 等一种或多种系统的使用、运维、平台集成或开发经验。
4. 熟悉 GPU 资源管理与调度机制,理解 GPU 资源分配、显存隔离、MIG、GPU 共享、拓扑感知调度、队列调度、Gang Scheduling、弹性调度等常见场景。
5. 熟悉云原生分布式训练平台相关生态,具备 Kubeflow、Volcano、Kueue、Argo Workflows、Ray、Slurm 等一种或多种系统的实际使用或平台集成经验,理解分布式训练任务的提交、编排、调度、监控、重试、弹性伸缩等核心机制。
6. 熟悉 PyTorch 分布式训练机制,理解 DDP、FSDP、Tensor Parallel、Pipeline Parallel、Data Parallel、ZeRO 等常见并行训练策略。
7. 熟悉 NCCL / MPI / Gloo 等通信机制,具备分布式训练通信问题排查经验,能够定位 NCCL 超时、Rank 异常、通信性能差等问题。
8. 具备 Go / Python / Shell 至少一种语言的开发能力,能够独立开发平台后端服务、运维工具、训练启动脚本、问题诊断工具或 Kubernetes Operator。
经验与背景(优先)
1. 有大规模 GPU 集群、智算中心、AI 训练平台、机器学习平台、分布式训练平台建设经验者优先。
2. 有 Kubernetes Scheduler、Volcano、Slurm、Kueue、Kubeflow Training Operator、Argo Workflows、Ray 等系统二次开发经验者优先。
3. 有多租户资源治理、GPU 利用率优化、任务排队调度、成本优化、资源计量计费经验者优先。
4. 有大模型训练、多机多卡训练、自动驾驶模型训练支撑经验者优先。
5. 有国产 GPU / 国产 AI 加速卡使用或适配经验者优先,如华为昇腾、阿里 PPU、寒武纪、海光、沐曦、壁仞等。
6. 熟悉 InfiniBand / RoCE、分布式存储、容器网络、镜像加速等 AI 集群底层能力者优先。
7. 熟悉 Prometheus / Grafana、NVIDIA DCGM、Nsight Systems、PyTorch Profiler 等监控与性能分析工具者优先。
8. 有平台产品化经验,能够从算法用户或客户视角优化任务提交、监控诊断、资源使用和训练任务运行体验者优先。