岗位描述
职位简介:
关键字:分布式训练加速、推理优化、CUDA、训推框架、推理引擎、性能分析
在AI军备竞赛中,算法决定模型的上限,而AI Infra决定模型迭代的下限与迭代速度。我们寻找的不仅是工程师,更是愿意深入计算底层、挑战极致性能优化的“极客”。你将直面千亿/万亿参数大模型在万卡集群上的训练加速与极致推理挑战,深度参与乃至主导公司自研训推一体化框架的设计与演进。
工作职责:
1. 训练:在PyTorch DDP/FSDP等已有框架上跑通单机多卡到多机多卡训练,处理通信同步问题,做吞吐调优(batch size/梯度累积/学习率);
2. 推理:用TensorRT/ONNX Runtime完成模型部署,做INT8/FP16/AWQ量化、剪枝,分析延迟和吞吐瓶颈到达标;
3. CUDA:能编写功能正确的CUDA kernel,理解warp调度和shared memory bank conflict,做基础kernel性能分析;
4. 框架:在已有框架代码库中做bug修复和功能添加,能独立开发新算子和优化Pass;
5. 性能:用Nsight/PyTorch Profiler收集profile,系统分析计算/通信/IO瓶颈,量化优化收益。
任职要求:
1. 本科及以上学历,计算机、软件工程、电子工程、通信工程等相关专业;
2. 精通C/C++、Python、Go中至少一种编程语言,具备良好的编码习惯和工程规范意识;
3. 具备扎实的计算机理论基础,深入理解数据结构、算法、操作系统、计算机网络;
4. 熟悉Linux开发环境,了解基本系统工具和Shell脚本的使用;
5. 了解分布式系统基本原理,对大规模集群的调度、容错、通信机制有一定认知;
6. 了解PyTorch、CUDA编程、NCCL、vLLM、TensorRT、DeepSpeed,或有GPU性能调优经验,加分;
7. 熟悉Kubernetes、Docker等容器化技术及其在AI场景下的应用,加分。