岗位描述
岗位职责
1. 异构算力管理:负责多类型AI芯片的纳管、适配与性能调优,保障异构算力的统一调度与高效利用;
2. 高速网络建设:负责智算中心RoCE v2、InfiniBand等高速网络的架构设计、部署与运维,保障万卡/十万卡级集群的低延迟、高带宽互联;
3. 集群性能调优:开展大规模AI训练集群的网络性能调优,优化通信算法、拓扑映射与参数配置,提升分布式训练效率;
4. 故障排查与稳定性保障:负责智算集群硬件与网络故障的快速定位与修复,建设监控告警与预防性维护机制,保障集群SLA。
岗位要求
1、本科及以上学历,计算机、电子工程、通信工程相关专业;
2、了解计算机体系结构与AI加速芯片(GPU/NPU)基本原理,了解计算机网络基础,熟悉TCP/IP协议,了解RDMA技术者优先,熟悉Linux系统操作与常用命令,了解Shell/Python脚本编写;
3、具备良好的问题排查与动手能力,对智算基础设施有浓厚兴趣,能适应机房运维工作;
4、具备良好的学习能力与责任心;
5、有AI集群、HPC或数据中心网络运维实习经验者优先,了解计算与通信库者优先,熟悉RoCE/InfiniBand网络配置与调优者优先。