岗位描述
1. GPU集群高性能存储架构设计与建设
负责大规模GPU算力集群高性能存储系统的架构设计、方案选型与落地交付,支撑AI大模型训练对高吞吐、低延迟、海量小文件并发访问的严苛需求。
主导并行文件系统(如Lustre、GPFS、BeeGFS等) 的规划部署与调优,设计合理的热数据-冷数据分层存储策略,平衡性能与成本。
参与存储系统与GPU集群的整体协同设计,优化数据加载、Checkpoint及KVCache等应用场景,避免存储成为算力瓶颈。
2. 存储性能深度调优与瓶颈攻坚
深入分析和优化存储系统的IOPS、吞吐量、延迟等核心指标,识别并解决数据加载阶段的性能瓶颈,确保GPU利用率达到最优。
针对AI训练场景中的海量小文件读取、Checkpoint大块写入和KVCache加载等典型负载,进行针对性的存储参数调优与缓存策略优化。
探索和落地GPU存储直通、NVMe-oF等前沿技术,打通存储与GPU之间的数据直通路径,降低CPU开销和I/O延迟。
3. 存储系统运维、监控与自动化
负责存储基础设施的7×24小时稳定运行,建立完善的监控告警体系(容量、性能、健康状态),实现故障的快速发现、定位与恢复。
制定并执行数据备份与容灾策略,保障训练数据与模型产物的持久性、一致性与可恢复性。
推进存储运维自动化,使用Ansible、Python、Bash等工具实现存储资源的自动化配置、巡检与扩缩容。
4. 跨团队协作与技术预研
与内外部工程师团队紧密协作,从存储视角为分布式训练框架的数据加载逻辑和并行策略提供优化建议。
跟踪存储领域前沿软硬件技术,针对下一代GPU集群的存储需求进行技术预研与选型评估。
二、任职资格
1. 基本条件
学历要求:全日制硕士及以上学历,计算机、电子工程、通信或相关专业。
工作经验:5年以上数据中心存储系统运维或架构设计经验,且具备至少1-2年直接参与GPU集群或高性能计算存储项目的实战经验。
2. 专业技能
存储系统精通:深入理解块存储、文件存储、对象存储的架构原理与适用场景,精通并行文件系统(Lustre/GPFS/BeeGFS至少其一) 的部署、调优与运维。
协议与网络:熟悉NFS、SMB、iSCSI、FC等存储协议,了解RDMA(InfiniBand/RoCE) 在存储场景中的应用原理。
Linux系统能力:具备扎实的Linux系统管理能力,熟练掌握文件系统(ext4/XFS/ZFS)原理及性能调优。
Linux内核开发能力:具备Linux内核开发能力,熟悉VFS,NVME驱动等技术。
脚本开发:熟练使用Python、Bash等语言编写自动化运维脚本。
3. 加分项
有参与千卡或以上GPU集群存储系统的落地经验。
具备GPU存储直通或NVMe-oF的研发、实际部署与调优经验。
熟悉AI训推技术及存储加速方案。
有大规模分布式存储系统的运维经验。
熟悉K8S、SLURM等作业调度系统与存储系统的集成。