锦鲤求职

文远知行

训练框架与性能优化工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位概述

负责公司自动驾驶端到端大模型训练平台的框架层建设。基于 PyTorch 生态进行深度定制与工程化,解决大规模分布式训练中的稳定性、扩展性与性能瓶颈问题,支撑千卡级 GPU 集群的高效训练迭代。

核心职责

1、分布式训练框架开发

基于 PyTorch 进行框架层二次开发,优化 DDP / FSDP / DeepSpeed / Megatron 等分布式方案在自动驾驶场景下的适配

解决大规模训练中的 Checkpoint 管理、弹性容错、动态重调度、长序列训练等工程难题

开发训练任务全链路可观测工具,集成性能分析体系,实现从 Python 层到 CUDA Kernel 的瓶颈定位

2、训练性能优化

推进 torch.compile 在训练场景中的规模化落地,解决 graph break、动态形状、自定义算子兼容等问题

基于 Triton 开发高性能融合算子,优化显存占用与 Kernel 执行效率

落地 FP8 精度训练方案,在保障收敛的前提下最大化硬件算力利用率

3、CUDA 与底层优化

针对自动驾驶计算特征(BEV 特征提取、时序融合、稀疏注意力等)开发并优化自定义 CUDA 算子

优化内存访问模式与计算并行度,使用性能分析工具指导算子融合与通信-计算重叠策略

4、通信与端到端协同

优化 NCCL 通信性能,分析通信拓扑瓶颈,实现通信与计算的高效重叠

与网络团队协作,针对 RoCE/RDMA 特征优化通信集合策略,解决大规模训练中的负载不均与慢节点问题

5、国产硬件适配

推进国产 GPU 适配工作,开发或迁移自定义算子,建立与 PyTorch 的兼容性测试与性能对标体系

任职要求

学历:计算机科学、软件工程或相关专业本科及以上学历

经验:2 年以上深度学习框架开发或高性能计算优化经验;有大规模模型训练落地经验者优先

技术基础:

精通 PyTorch 内部机制,熟悉 Autograd、Dispatcher、ATen 算子库及 Python/C++ 混合开发

扎实的 C++ / Python 编程能力,具备 CUDA 编程与性能调优实战经验

熟悉分布式训练原理,深入理解数据并行、模型并行、流水线并行及 ZeRO 优化器

领域知识:

熟练使用 Nsight Systems、Nsight Compute、PyTorch Profiler 进行全链路性能分析

了解 AI 编译器技术栈(Triton / Inductor),具备图优化与算子融合经验

熟悉混合精度训练原理与数值稳定性保障机制

加分项

为 PyTorch、DeepSpeed、Megatron-LM、Triton 等开源项目贡献过代码

有自动驾驶 / 计算机视觉 / 多模态大模型训练优化经验

具备 FP8 训练或国产 GPU(昇腾 / 海光等)适配落地经验

熟悉 PyTorch 2.x 新特性(torch.compile / torch.export / custom operator)并有生产环境实践

我们提供

核心战场:你的代码将运行在千卡集群的每一条训练任务上,直接决定有效算力产出

全栈纵深:从 Python 框架层到 CUDA Kernel,从编译器到 SASS 指令,覆盖 AI 训练全链路

跨团队协同:与调度器、网络、算法团队深度配合,端到端解决训练效率问题

技术影响力:工作成果直接量化为集群 MFU 提升,推动开源社区技术沉淀

后端开发方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →