岗位描述
职位描述:
我们正在建设面向自动驾驶大型模型训练的 AI 基础设施平台,支持多云异构 GPU 集群、训练任务调度、数据与算力协同,以及大规模 AI Workflow 的稳定运行。你将参与 AI 训练平台与生产系统的设计、建设与持续优化,提升整体资源效率、系统稳定性与研发体验。
工作内容:
AI 训练基础设施建设与运维
参与 GPU 集群、Kubernetes 平台的建设与稳定性优化
支持大规模训练任务的运行与问题排查
参与训练链路的资源调度、任务治理与容量管理
优化训练平台的可用性、可观测性与自动化能力
平台稳定性与效率优化
参与训练任务异常恢复、告警、监控体系建设
协助定位训练性能问题(网络 / 存储 / GPU / 调度等)
持续提升 GPU 利用率与资源交付效率
推动平台工程化与标准化建设
AI Workflow 与云平台协同
支持 Argo Workflow / GitLab CI 等平台能力建设
参与多云资源管理与异构算力接入
协助建设统一 AI 生产系统与研发工作流
任职要求:
基础要求:
熟悉 Linux、网络与容器基础设施
熟悉 Kubernetes 生态与常见运维工具
具备一定自动化运维或平台开发能力(Python / Go 等)
具备较强的问题定位与工程推进能力
加分项:
以下经验任意方向有了解即可:
GPU / AI 训练平台相关经验
Kubernetes GPU 调度经验
RDMA / 高性能网络经验
Argo Workflow / Ray / Slurm 使用经验
大模型或自动驾驶训练平台经验
存储系统(Alluxio / Ceph / Lustre / GPFS 等)经验
多云平台或混合云经验