锦鲤求职

地平线机器人

【2027届校招】模型训练优化工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

工作内容
你将参与的事
作为模型训练优化工程师,你将深入大模型训练系统的核心,确保自动驾驶 AI 模型的训练高效、稳定、可扩展。你将参与以下方向:
大规模训练稳定性保障:解决千卡/万卡集群训练过程中的软硬件故障、通信瓶颈、数据同步等问题;设计容错与弹性恢复机制,让训练任务在节点故障时能够快速自愈,保障长周期训练的连续性
训练效率极致优化:结合自动驾驶场景的海量多模态数据(视觉、点云、传感器融合)和大模型架构(BEV+Transformer、端到端、VLA、世界模型),持续优化训练吞吐量和收敛效率
分布式训练框架开发与优化:深入参与 DeepSpeed、Megatron-LM、PyTorch FSDP 等主流训练框架的定制开发与性能优化,探索 3D 并行策略(数据并行 / 张量并行 / 流水线并行)、Expert Parallelism(MoE 场景)、通信拓扑优化等前沿技术
故障诊断与可观测性:构建面向大规模训练集群的故障快速定位系统,利用日志分析、性能剖析和分布式追踪技术实时监控训练状态,缩短问题排查周期

任职条件
我们需要的人
基本要求
1.2027届本科及以上学历,计算机科学、人工智能、软件工程、电子工程等相关专业
2.扎实的编程能力:熟练掌握 Python 和 C/C++,具备良好的数据结构与算法基础,能写出高性能、可维护的工程代码
3.系统级理解:了解 Linux 编程,对多线程、内存管理、网络通信、GPU 计算等底层技术有兴趣和基础认知
4.深度学习框架经验:熟悉 PyTorch 等主流深度学习框架,理解其计算图、自动微分、分布式训练的基本原理
5.对大模型训练有热情:关注 LLM / 多模态大模型训练的技术发展,愿意深入理解分布式训练的底层机制
6.良好的沟通能力与责任心:善于团队协作,能主动推进问题解决
加分项
1.分布式训练框架经验:有 DeepSpeed(ZeRO / ZeRO++ / 3D 并行)、Megatron-LM / Megatron-Core、PyTorch FSDP 等框架的实际使用或源码级理解经验
2.GPU 编程与优化:熟悉 CUDA 编程,有 kernel 开发和性能调优经验;了解 FlashAttention、Triton 等 GPU 加速技术
3.训练优化技巧:了解混合精度训练(FP16/BF16/FP8)、激活重计算(Activation Checkpointing)、梯度累积、通信与计算重叠等优化方法
4.竞赛或科研经历:ACM/ICPC、Kaggle 等竞赛获奖,或在 AI / 系统领域顶会(NeurIPS/ICML/CVPR/MLSys/ATC)发表论文
5.相关实习经验:在头部科技公司有大模型训练优化、AI Infra 或自动驾驶算法工程相关的实习经历

为什么选择我们
真实的大规模训练场景:你将面对自动驾驶领域独有的海量多模态数据和复杂模型架构,参与千卡级集群上的真实训练任务
技术深度与广度:从 CUDA kernel 级优化到分布式训练框架设计,从单节点性能调优到万卡集群稳定性保障,技术栈纵深覆盖
快速成长:与自动驾驶和大模型训练领域的资深工程师共事,完善的技术导师制度助你快速成为训练优化领域的核心人才
行业前沿:行业正处于端到端大模型和 VLA 技术爆发期,你的工作将直接影响下一代智能驾驶系统的训练效率

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →