岗位描述
工作内容:
框架可用性拓展:负责自动驾驶大模型分布式训练框架的可用性优化,降低模型接入的成本。
稳定性与可观测性建设:建设训练集群的监控与告警体系,实时追踪训练吞吐、网络通信、集群健康度等指标,参与长周期训练的自动容错与断点续训优化。
全链路性能调优(Profiling):使用专业调优工具(如 TensorBoard, Nsight)对大模型训练进行性能画像(Profiling),找出计算、通信和 I/O 上的长尾卡点,并进行优化。
岗位要求:
教育背景:计算机、软件工程、电子信息、系统结构等相关专业。
底层功底:精通 C/C++ 或 Python,对计算机体系结构(如 CPU 缓存、内存管理、多线程/多进程)有扎实的理解。
框架了解:熟练使用 PyTorch,了解其底层的分布式训练基本概念(如 DDP、数据并行)。
系统基础:熟悉 Linux 操作系统原理,掌握基本的 Shell 脚本编写。
加分项:
选修或自学过 CUDA 编程,写过简单的自定义算子,或了解 GPU 硬件架构。
在校期间有分布式系统、高性能计算(HPC)、或者深度学习模型工程化部署(TensorRT等)的实验/项目背景。