岗位描述
岗位职责
面向超大规模 AI 数据中心(AIDC),负责 AI 高性能网络与通信技术的研发、优化及规模化落地。聚焦 NVLink、CXL、RDMA/RoCE 等 Scale-up/Scale-out 高速互联,深入优化网络拓扑、传输协议、拥塞控制与流量调度,并结合集合通信、P2P 通信等高性能通信库,开展从底层网络、通信库到大模型训推框架的端到端协同优化与深度可观测能力建设,持续提升算力与网络资源利用效率,为小红书大模型训练与推理业务提供极致性能、稳定性与成本效益。
岗位要求
1、精通 C/C++,熟悉 Python,具备扎实的计算机系统、数据结构与算法基础,在复杂系统研发、性能分析与极致优化方面有一定经验;
2、深入理解 AI 高性能网络与高速互联体系,具备 RoCE、InfiniBand、NVLink、CXL 等核心技术研发或深度优化经验,对网络拓扑、传输协议、拥塞控制(如 DCQCN)、流量调度及性能调优有相关实践;
3、深入理解集合通信与分布式通信原理,具备 NCCL、DeepEP、Mooncake 等通信库研发/优化经验,能够针对 Collective、P2P 等通信模式进行算法、协议及系统级优化;
4、深入理解大模型训练/推理系统及分布式并行技术,熟悉 Megatron-LM、vLLM、SGLang 等主流框架;
5、具备软硬件协同优化能力,熟悉 GPU、NIC、DPU/SmartNIC 等硬件架构及 DOCA 等可编程技术
6、深入理解 CUDA/GPU 体系架构,具备 CUDA Kernel、通信 Kernel 及计算通信重叠等性能优化经验;
7、具备优秀的学习能力和跨团队协作、技术推动能力。