岗位描述
一、岗位职责
1. GPU集群高性能网络架构设计与建设
2. 网络协议深度调优与性能优化
3. 网络运维、监控与自动化体系建设
4. 跨团队协作与技术预研。
二、任职资格
1. 基本条件
● 学历要求:全日制硕士及以上学历,计算机、网络工程、通信工程或相关专业。
● 工作经验:5年以上数据中心网络运维或架构设计经验,且具备至少1-2年直接参与GPU集群或高性能计算项目的实战经验。
2. 专业技能
● 协议栈精通:深刻理解TCP/IP协议栈,精通BGP、OSPF、VXLAN等路由交换及Overlay技术。
● 高性能网络专长:深入理解InfiniBand与RoCEv2的工作原理与差异,具备大规模集群下RDMA网络的独立部署与性能调优经验。
● 设备与工具实操:熟练掌握至少一款RDMA主流厂商的高性能交换机配置能力;精通Wireshark、iperf、tcpdump等网络分析工具。
3. 加分项
● 有主导或参与1K或以上规模GPU集群网络设计的经验。
● 熟悉CUDA编程模型或GPU底层通信原理、有通信库调优经验。
● 熟悉SUE/ESUN/UALINK等Scalueup网络协议。
● 具备DPU/智能网卡的卸载及编程经验。
● 持有CCIE/HCIE或同等水平的专家级网络认证。