岗位描述
工作内容
你将参与的事
作为 AI 基础架构平台工程师,你将深入分布式系统与高性能计算的核心地带,为大规模 AI 计算构建坚实的底层平台。你将参与以下方向:
大规模集群调度与资源管理:设计和优化面向万卡级 GPU/BPU等异构加速芯片集群的资源调度系统,解决拓扑感知调度、故障自愈、弹性扩缩容、多租户资源隔离等工程难题
分布式计算框架:基于主流分布式计算框架构建高效的任务编排与执行引擎,设计灵活的 workload 封装与调度抽象,支撑数据并行、模型并行、流水线并行等多种并行策略
高性能数据访问层:构建面向 AI 工作负载的数据分发与缓存系统,解决训练/推理场景下数据集加载、模型权重分发、Checkpoint 管理等数据访问瓶颈
CPU 计算效率优化:深入挖掘 CPU 侧的计算性能,优化数据预处理、特征工程、任务调度等 CPU 密集型环节的整体效率,提升 CPU-GPU 协同吞吐
集群可观测性与效能平台:构建集群监控、性能剖析和容量规划工具,通过数据驱动持续发现系统瓶颈并优化
任职条件
我们需要的人
基本要求
1.2027届本科及以上学历,计算机科学、软件工程、电子工程等相关专业
2.扎实的计算机基础:深入理解操作系统原理(进程调度、内存管理、文件系统、Linux 内核)、计算机网络(TCP/IP、RDMA)、数据结构与算法
3.优秀的系统编程能力:熟练掌握 C/C++/Go/Rust 中至少一种语言,具备良好的并发编程和性能优化意识
4.分布式系统认知:了解分布式一致性、容错机制、负载均衡等基本概念,对构建大规模分布式系统有强烈兴趣
5.高性能计算兴趣:对 GPU 计算、异构计算、集群调度、低延迟网络等方向充满好奇,愿意深入底层解决系统级问题
6.良好的沟通协作能力与自驱力:能主动发现问题、提出方案并推动落地
加分项
1.分布式框架经验:有 Kubernetes、Volcano、Ray等项目的的开发经验
2.系统开发实习:在头部科技公司的基础架构、分布式系统、云计算或 HPC 团队有实习经验
3.对 AI 工作负载有了解:熟悉大模型训练/推理的资源需求特征(显存占用、通信模式、Checkpoint 策略等),能从平台视角理解 AI 系统的工程挑战
4.高性能计算经验:熟悉 CUDA 编程、GPU 计算优化、NCCL/MPI/RDMA 分布式通信,或接触过 DeepSpeed、Megatron-LM 等分布式训练框架的系统层实现
5.竞赛或科研经历:ACM/ICPC 等算法竞赛获奖,或在系统领域顶会(OSDI/SOSP/ATC/EuroSys/NSDI)发表论文
为什么选择我们
真正的系统级挑战:你将面对万卡级集群调度、微秒级网络优化、分布式计算框架设计等行业最前沿的系统工程问题
真实的工程影响力:代码直接运行在大规模生产集群上,你的每一行优化都在加速整个公司的 AI 研发效率
成长空间:完善的技术导师制度,与系统领域顶尖工程师共事,快速成长为分布式系统与高性能计算领域的核心人才
开放文化:鼓励技术创新和开源贡献,支持参与顶级系统领域学术会议和社区