锦鲤求职

蚂蚁集团

【蚂蚁星】AI Infra 训练引擎 / 训练框架研发工程师-大安全-27届

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位描述
部门介绍:
在万卡规模上,重新定义大模型训练基础设施。我们正在建设面向大模型时代的 AI Infra,支撑超大规模算力集群稳定运行,覆盖预训练、持续预训练、SFT、RL、MoE、多模态等多种训练场景。深入训练系统的核心:从分布式并行、通信优化、算子融合,到容错恢复、精度保障和资源调度,让百亿、千亿、万亿参数模型在大规模异构集群上真正做到——跑得起来、稳定收敛、极致高效。目前平台已支撑上万次大模型训练任务,训练任务规模持续增长。你将参与建设的每一项能力,都将在真实的万卡集群和核心业务模型上接受检验。
为什么加入我们:你面对的不是实验室级的小规模 Demo,而是:万卡级算力规模、真实的大模型训练负载、复杂的生产级硬件环境,以及仍有大量空白等待突破的训练系统。你可以在这里同时获得训练框架的技术深度、万卡集群的系统复杂度,以及与顶尖团队共同探索新模型、新架构的机会。成为下一代大模型训练基础设施的建设者。

职位描述:
1. 研发大模型训练引擎与训练框架,支持 CPT、SFT、RL、MoE、长上下文及多模态训练;
2. 深入 PyTorch、Megatron、FSDP、verl等训练体系,设计张量并行、流水并行、数据并行、专家并行等分布式方案;
3. 面向万卡级集群优化计算、通信、显存和存储效率,解决训练中的性能长尾、通信瓶颈和规模化稳定性问题;
4. 建设 Checkpoint、断点续训、故障自愈、弹性训练、精度比对和可观测能力,提高大规模训练成功率;
5. 适配多种 AI 芯片及异构算力平台,推动训练框架、通信库、算子与硬件之间的深度协同;
6. 深入 Algorithm-System Co-design,让新的模型结构和训练方法能够更快、更高效地落地。

岗位要求
1.熟悉 Python、C++ 中至少一种语言,具备良好的系统设计和工程实现能力;
2. 熟悉 PyTorch 训练机制,对分布式训练、并行策略、显存优化或高性能计算有实践经验;
3. 对 Megatron-LM、FSDP、verl 等框架中的一种或多种有深入理解;
4. 熟悉 NCCL/HCCL、RDMA、集合通信、GPU/NPU 算子优化者优先;
5. 有大模型预训练、MoE、长序列、强化学习训练或千卡级集群实践经验者优先;
6. 喜欢解决真正困难的问题,愿意从模型、框架、系统一直深入到芯片和网络。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →