岗位描述
岗位定位
负责公司级 AI 基础设施与平台建设,面向大模型训练、后训练、评测、部署和推理场景,打造稳定、高效、易用的端到端 AI 平台,持续提升 GPU 资源利用率、研发效率和算力投入产出比。
核心职责
负责大规模 GPU 集群的整体规划、资源管理与调度,持续提升集群稳定性和资源利用率。
建设端到端训练及后训练平台,覆盖数据接入、任务编排、分布式训练、SFT、偏好优化与 RL、实验管理、模型评测及模型资产管理。
建设统一推理平台,支持模型部署、在线及离线推理、服务治理、弹性扩缩容、多租户和高可用。
建立 GPU 利用率、训练稳定性、推理吞吐与时延、平台 SLA 和算力成本等指标体系,持续推动平台优化。
制定 AI 平台技术路线和演进规划,推动平台能力标准化、自助化及规模化落地。
负责团队建设和人才培养,协同算法、业务及基础设施团队完成关键项目交付。
任职要求
具备大型 AI Infra、机器学习平台或云计算平台的架构设计及团队管理经验。
主导过千卡级或以上的 GPU 集群建设,熟悉资源调度、故障恢复、多租户隔离及集群稳定性治理。
主导过大模型训练和推理平台建设,对数据、训练、评测、部署及推理的端到端链路有系统性理解。
理解 SFT、偏好优化、RL 等后训练流程及资源特征,具备相关任务的平台化支撑经验。
熟悉 Kubernetes、Ray、PyTorch 等技术生态,了解 vLLM、SGLang、Fluid 等推理服务与数据加速组件或同类方案,能够完成技术选型和平台集成。
对计算、存储、网络及分布式系统有较全面的理解,能够解决复杂的平台架构与工程问题。
有 GPU 利用率、训练稳定性、推理性能或算力成本优化的实际经验。
具备较强的技术判断力、平台产品意识、团队管理及跨团队推动能力。
加分项
有万卡级集群、异构算力、跨地域集群或混合云管理经验。
建设的平台服务过多个算法或业务团队,并有较大规模的生产落地。
有完善的 AI 平台稳定性、可观测性或算力成本治理体系的经验。