岗位描述
岗位职责
参与自研AI芯片上高性能集合通信库(类似NCCL/RCCL) 的设计与开发,深入分布式训练的核心。
针对多机多卡集群拓扑,优化节点内(如NVLink/PCIe)及节点间(如RoCE/InfiniBand)的通信算法,挑战通信与计算重叠的极致性能。
在资深导师指导下,使用性能分析工具定位通信瓶颈,并针对特定硬件架构进行微架构级别的调优。
编写高质量的代码、技术文档,并参与团队技术评审。
任职要求
核心技能:熟练掌握C++,对计算机体系结构和操作系统有深入理解。
其他
加分项(必备其一):有CUDA编程或MPI并行计算经验;熟悉NCCL、OpenMPI等主流集合通信库;了解RDMA、GPUDirect等技术。
硕士在读(2026届优先),能保证每周4天以上、至少6个月的实习。
你将收获:直面分布式训练中最关键的通信效率问题,掌握决定千卡、万卡集群线性加速比的核心技术。
由来自AMD、NVIDIA等公司的资深专家一对一指导,快速建立系统级视野。
表现优异者(最快3个月)可获得校招转正Offer,提前锁定加入国产AI芯片顶尖团队的机会。