锦鲤求职

九识智能

【27届校招】模型训练性能优化工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

About the Role

我们正在打造自动驾驶领域的 高性能 AI Training System(高性能训练系统),持续推动大规模模型训练的效率提升。随着自动驾驶模型从传统感知网络逐步演进到 End-to-End Driving 与 VLM(视觉语言模型),训练规模、GPU 集群规模以及数据规模都在快速增长,训练效率已经成为核心竞争力之一。

我们希望找到对 GPU、CUDA、PyTorch、分布式训练 或 AI Infrastructure 感兴趣的同学,一起参与训练系统优化工作。你将直接接触真实的大规模模型训练任务,参与分析训练瓶颈、优化 GPU 利用率、提升训练吞吐,并探索包括 CUDA Kernel Fusion、Communication Optimization、Mixed Precision、Torch Compile、CUDA Graph 等前沿训练加速技术。

Responsibilities

参与自动驾驶模型训练加速与性能优化,包括:Data Pipeline Optimization(数据流水线优化)、GPU utilization optimization(GPU利用率优化)、Training throughput optimization(训练吞吐优化)

参与分布式训练系统优化,包括:Multi-GPU / Multi-node Training(多机多卡训练)、Communication Optimization(通信优化)、Overlap Communication & Computation(通信计算重叠)

参与训练框架与 Runtime 优化:PyTorch Runtime Optimization、CUDA Kernel Optimization、Memory Optimization(显存优化)、Mixed Precision Training(混合精度训练)

分析并优化模型训练瓶颈,包括:GPU compute bottleneck、Data loading bottleneck、Kernel launch overhead、Distributed synchronization overhead

参与自动化性能 Benchmark 与 Profiling 系统建设:GPU profiling、Training regression analysis、Performance benchmarking

跟踪并研究前沿训练加速技术,包括:FlashAttention、Fused Operators、Torch Compile、CUDA Graph、Triton Kernel、Distributed Training Optimization

Requirements

计算机、电子工程、人工智能或相关专业本科/硕士,具备较强工程能力与学习能力。

熟悉 Python 或 C++ 编程,具备良好的代码能力。

熟悉深度学习框架之一:PyTorch、TensorFlow 或 JAX

对 GPU / 并行计算 有一定理解,包括:CUDA execution model、GPU memory hierarchy、Thread / Warp execution、GPU performance basics

熟悉深度学习训练流程:Forward / Backward propagation、Optimizer、Distributed Data Parallel(DDP)、Mixed Precision Training

具备基本性能分析能力,能够使用 profiling 工具定位性能瓶颈。

Preferred Qualifications

有以下方向经验之一:CUDA Programming、Distributed Training、GPU Kernel Optimization、AI Compiler、ML Systems

熟悉以下工具或框架之一:Nsight Systems、Nsight Compute、PyTorch Profiler、DeepSpeed、Megatron-LM、Horovod

有以下优化经验之一:CUDA Kernel Fusion、Memory Optimization、Communication Optimization、Training Throughput Optimization

熟悉自动驾驶 / 多模态模型 / 大模型训练相关技术。

有开源项目、竞赛或科研经历加分。

What You Will Gain

在这里你将有机会:

参与自动驾驶 AI Training Infrastructure(AI训练基础设施)研发

深度接触 大规模模型训练加速 与 GPU 性能优化

与经验丰富的 GPU / AI Infra 工程师共同开发核心训练系统

参与自动驾驶大模型与 VLM 的训练优化实践

快速成长于 Distributed Training、CUDA、ML Systems 与 AI Infrastructure 领域

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →