锦鲤求职

阿里巴巴

大模型Infra研发工程师(训练/推理)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位描述
1. 负责大模型全链路训练优化,攻克 Scaling Law 过程中的分布式性能瓶颈,提升 MFU(算力利用率)和训练稳定性,保障万亿级参数模型的交付;
2. 设计并研发领先的推理引擎,包括但不限于算子融合、动态图优化、量化压缩(FP8/INT4)、高效 CUDA 算子开发等,降低模型在线时延与计算成本;
3. 针对特定业务场景,进行软硬件联合优化,实现从预训练、SFT、RLHF 到模型部署的端到端技术突破。

岗位要求
1. 本科及以上学历,计算机、人工智能、软件工程、数学相关专业优先;
2. 精通 C++/Python,具备卓越的工程实现能力;熟练掌握 PyTorch 或 TensorFlow,深入理解其内部机制及算子实现;
3. 熟悉 GPU 硬件架构及并行计算原理,掌握主流训练框架或推理框架;
4. 熟悉 Transformer 架构,对模型量化、蒸馏、剪枝或算子优化(CUDA/Triton)中的某一项有深入研究或实践经验。
5. 具备极佳的逻辑分析能力和数理基础,对前沿问题有持续热情,能适应快节奏的研发环境,具有跨学科协作意识。

【加分项】
1. 科研影响力: 在 NeurIPS, ICLR, ICML, ACL, OSDI, SOSP 等计算机顶会以第一作者发表过论文;
2. 深度参与过主流 MLSys 相关开源项目(如 vLLM, OpenRLHF, Megatron 等)的开发或在 ACM/ICPC、Kaggle 等竞赛中获得过顶尖名次。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →