岗位描述
岗位职责
1.负责 VLM/VLA/WAM、视频模型、世界模型、机器人策略模型等大模型的分布式训练方案设计、实现与优化。
2.与算法工程师深度协作,理解模型结构、loss 设计、数据配比、训练 recipe 和评测指标,支持大规模预训练、后训练和模型迭代。
3.设计并优化多机多卡并行训练策略,包括 Data Parallel、Tensor Parallel、Pipeline Parallel、FSDP、ZeRO、Sequence Parallel、MoE 并行等。
4.参与训练算法和训练稳定性优化,包括混合精度、梯度累积、梯度裁剪、学习率调度、激活重计算、checkpoint、显存优化和 loss 异常分析等。
5.对训练性能进行 profiling,定位 GPU 计算、通信、I/O、DataLoader、NCCL、存储等瓶颈,提升训练吞吐、MFU、稳定性和实验迭代效率。
6.优化多模态/机器人数据训练管线,支持图像、视频、文本、轨迹、状态、动作序列等数据的高效读取、采样、缓存和混合训练。
7.建设算法友好的训练工具链,包括实验配置管理、训练监控、日志分析、异常诊断、checkpoint 管理和自动评测接入。
任职要求
1.计算机、人工智能、软件工程、自动化、机器人、电子工程、数学等相关专业硕士及以上学历。
2.具备扎实的深度学习基础,理解 Transformer、Attention、Optimizer、Loss Function、Learning Rate Schedule、Mixed Precision 等训练机制。
3.熟悉 PyTorch,能够独立实现和调试复杂模型训练流程,具备良好的 Python 工程能力;熟悉 C++/CUDA/Triton 者优先。
4.熟悉大模型分布式训练技术,掌握 DDP、FSDP、ZeRO、Tensor Parallel、Pipeline Parallel、Sequence Parallel、MoE 并行、NCCL 通信优化等至少两类能力。
5.有实际大模型训练经验,能够结合模型结构、训练配置、数据格式和硬件资源设计合理的训练方案。
6.熟悉大规模训练常见问题定位,包括 OOM、nan/inf、loss spike、梯度异常、训练不收敛、通信阻塞、DataLoader 慢、checkpoint 慢等。
7.熟悉 GPU 集群训练环境,了解 Slurm、Kubernetes、Docker、NCCL、RDMA、InfiniBand、NVLink、分布式存储或对象存储等。
8.有 VLM、LLM、视频模型、Diffusion Model、VLA、World Model、机器人策略模型训练经验者优先。