锦鲤求职

文远知行

RDMA 网络工程师(高级/资深)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位概述

负责公司千卡级 GPU 训练集群的 RDMA/RoCE 网络架构与性能优化。面向大规模分布式训练(PyTorch/NCCL)的高带宽、低延迟、零丢包需求,设计并落地网络流控、拥塞避免与全链路可观测体系,保障 RDMA 网络在极端负载下的稳定性与吞吐效率。

核心职责

1、RoCE 网络流控与拥塞控制

设计并实施 RoCEv2 网络拥塞控制方案,基于 ECN、PFC、DCQCN / TIMELY / Swift 等算法进行场景化选型与参数调优

构建网卡与交换机的 QoS 策略体系,包括流量优先级映射、缓冲区管理与流量整形,抑制 Incast 与拥塞扩散

针对 AllReduce / AllToAll 等通信模式特征,优化网络侧流控参数,实现训练通信与网络容量的匹配

2、网络缓冲区与链路调优

系统调优网卡与交换机的端口缓存、PFC 阈值及 Headroom 配置,适配不同链路距离与 MTU 场景

建立训练规模(节点数、并发流数)与网络 buffer 配置的映射模型,推进调优过程的参数化与自动化

监控链路级硬件指标(buffer 溢出、Pause 帧、物理层丢包),建立异常阈值告警与自愈机制

3、RDMA 全链路可观测与故障定位

构建覆盖网卡、交换机、训练任务的三层可观测体系,实现拥塞事件、通信降速、断流的分钟级定位

开发 Pause 帧异常与拥塞根因分析工具,区分 RDMA 训练流量与存储/管理面流量

建立 RDMA 网络故障知识库,覆盖 CRC 错误、FEC 纠错、链路降速等典型场景,提升排查效率

4、网络与训练协同优化

与调度团队协作,将网络拓扑与实时拥塞状态反馈至调度器,支撑拓扑感知的节点分配与流量避让

与训练框架团队协作,优化 NCCL 通信集合与网络拓扑发现策略,降低跨交换机流量

解决 VXLAN + RDMA 硬件卸载、容器化网络(SR-IOV / MACVLAN)等复杂场景下的数据面异常与性能回退

5、网络工程化与自动化

开发网络配置的统一下发、一致性校验与灰度回滚工具,保障千节点规模下的策略可靠性

建立网络性能基准测试与混沌测试体系,验证极端负载下的流控有效性

任职要求

学历:计算机科学、通信工程或相关专业本科及以上学历

经验:2 年以上高性能网络 / 数据中心网络 / RDMA 相关开发或运维经验;有大规模 GPU 集群(500+ 节点)网络建设经验者优先

技术基础:

深入理解 RDMA/RoCEv2 协议栈,熟悉 PFC、ECN、DCQCN 等拥塞控制机制的原理与部署

熟悉 Mellanox 网卡驱动生态及相关网络调优工具链,具备 Linux 内核网络子系统实战经验

了解 eBPF、DPDK 或具备网络流量分析经验,能够开发自定义监控与诊断工具

领域知识:

理解分布式训练通信模式(Ring / Tree AllReduce、AllToAll),能将网络行为与训练性能关联分析

熟悉数据中心交换机(Mellanox Spectrum / Cisco / Arista 等)的 QoS、ACL、ECN 标记配置

了解 GPU 服务器硬件架构(PCIe 拓扑、NIC 部署、NUMA 亲和性)对网络性能的影响

加分项

有 Mellanox CX6 / CX7 系列网卡深度调优经验,熟悉高级 QoS 参数与固件特性

具备基于 eBPF 的 RDMA 流量监控或拥塞事件捕获经验

有 VXLAN/EVPN + RDMA 硬件卸载、容器化 RDMA(Kubernetes RDMA Device Plugin)部署经验

熟悉 NCCL 调试方法或具备 Nsight Systems 网络性能分析经验

有网络自动化(Ansible / Python / SONiC)或网络数字孪生(仿真测试)经验

我们提供

核心战场:直接参与千卡级训练集群 RDMA 网络建设,解决拥塞控制、流控风暴、断流定位等业界硬骨头问题

全链路视角:与调度器、训练框架、GPU 驱动团队深度协同,从网卡到交换机到应用层端到端优化

技术深度:鼓励深入硬件规格、固件参数与协议细节,积累可复用的网络调优方法论与工具链

影响力:你的网络策略将直接决定大模型训练的效率与稳定性,工作成果高度可量化

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →