岗位描述
岗位描述
部门介绍
我们正在建设面向大模型时代的 AI Infra,覆盖训练与推理全链路,支撑万卡级算力集群和真实业务模型的训练、压缩与推理部署,覆盖 CPT、SFT、RL、MoE、多模态、模型蒸馏等场景。这里不是实验室里的小规模 Demo,而是真实的大模型训练与推理负载和生产级复杂环境。你会接触分布式训练、推理加速、通信优化、算子优化、容错恢复、精度保障、资源调度、异构芯片适配等核心问题,也有机会参与新模型、新架构与训练/推理系统的 Algorithm-System Co-design。
我们希望吸引对 AI Infra 有兴趣、基础扎实、动手能力强的同学,在真实项目中一起解决有挑战的问题。
职位描述
1. 参与大模型训练框架和训练基础设施研发,支持 CPT、SFT、RL、MoE、长上下文及多模态训练;
2. 参与大模型推理框架和基础设施研发,包括模型量化、PD 分离、CUDA Graph、分布式 KV Cache 等推理加速与显存优化技术;
3. 参与 PyTorch、Megatron、FSDP、verl、vLLM、SGLang 等训练和推理体系的适配和优化,学习并实践 TP、PP、DP、EP 等分布式并行方案;
4. 参与模型蒸馏算法研发与落地,包括大小模型蒸馏、OPD、MOPD、Eagle 投机解码等技术,提升推理效率与效果;
5. 参与大规模训练与推理中的性能分析和优化,包括计算、通信、显存、长尾及资源利用率等问题;
6. 参与 Checkpoint、断点续训、故障恢复、精度比对、可观测等稳定性能力建设;
7. 参与国产及异构 AI 芯片的训练/推理适配与性能优化。
岗位要求
1. 熟悉 Python、C++ 中至少一种语言,具备良好的系统设计和工程实现能力;
2. 熟悉 PyTorch 训练/推理机制,对分布式训练、并行策略、显存优化或高性能计算有实践经验;
3. 对 Megatron-LM、FSDP、verl、vLLM、SGLang 等框架中的一种或多种有深入理解;
4. 熟悉 NCCL、RDMA、集合通信、GPU/NPU 算子优化者优先;
5. 熟悉模型量化、PD 分离、投机解码等推理加速技术,或有模型蒸馏算法实践经验者优先;
6. 有大模型预训练、MoE、长序列、强化学习训练或千卡级集群实践经验者优先;
7. 喜欢解决真正困难的问题,愿意从模型、框架、系统一直深入到芯片和网络。