岗位描述
我们面向2026届毕业生开放此岗位,旨在寻找对高性能计算、分布式系统和AI基础设施有强烈好奇心的新锐力量。你将与资深技术专家一起,参与下一代AI集群通信与并行计算组件的研发,并在真实的大模型训练/推理场景中快速成长。欢迎敢想、敢试、敢突破的你,一起定义下一代AI计算基础设施!
工作职责:
1.跟踪并研究业界最新的分布式通信协议、并行计算框架及AI芯片互联技术,参与技术调研与原型验证
2.在导师指导下,参与高性能、低延迟分布式通信组件和并行计算组件的设计、开发与测试
3.协助完成集群环境下大模型训练/推理任务的系统调优,包括通信拓扑优化、负载均衡和资源调度
4.参与性能分析工作,使用各类工具定位瓶颈,并提出优化思路
5.有机会接触下一代人工智能芯片的互联架构设计,贡献年轻视角和创新想法
职位基本要求:
1.计算机、电子工程、数学、自动化等相关专业,2026年应届硕士及以上学历,特别优秀的本科生亦可
2.对AI基础设施或高性能计算有浓厚兴趣,了解基础的AI模型原理(如Transformer架构、分布式训练基本概念)
3.具备扎实的计算机基础知识,包括操作系统、计算机网络、数据结构与算法
4.熟悉Linux环境下的C/C++编程,具备一定的CUDA编程基础或愿意快速学习CUDA
5.积极主动,自驱力强,乐于钻研技术难题;具备良好的团队沟通和协作能力
职位要求加分项:
1.在校期间有集群环境下的模型训练、调优或部署经验(如课程项目、竞赛、实验室课题)
2.接触过Megatron-LM、DeepSpeed、FairScale等大模型训练框架,或对张量并行、流水线并行等切分策略有基本认知
3.了解OpenMPI、NCCL、NVSHMEM等通信库,或有MPI/多机通信编程经验
4.对GPU体系结构、虚拟化、存储系统、编译器或HPC领域有初步探索
5.熟悉Linux内核或驱动开发基础知识
6.曾使用perf、VTune、gperftools等性能分析工具进行过简单调优实践