锦鲤求职

太极图形

AI Infra 工程师实习生 - 多模态模型分布式训练系统方向

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
岗位职责:

1、参与多模态基座模型的分布式训练系统研发工作,在指导下完成相关功能特性的开发、测试与维护。
2、协助进行分布式训练流程的搭建与调试,支持多模态模型分布式训练使能。
3、参与训练性能的优化与问题分析定位,协助完成算子、通信、显存等性能数据采集与分析,配合团队完成算力利用与训练吞吐、显存占用、集合通信等关键指标的监控与优化。
4、跟进调研业界前沿的分布式训练技术,在团队内分享相关成果。
5、协助编写、维护相关文档与测试用例,参与分布式训练工具链的易用性改进,沉淀团队最佳实践。

岗位要求
岗位基本需求:

1、计算机、人工智能等相关专业本科及以上学历在校生。
2、具备扎实的计算机理论基础,熟练掌握 Python 或 C++ 语言,有良好的编码规范意识。
3、熟悉 Linux 常用命令与 Git 等常用工具基本操作,具备基本的工程协作能力。
4、了解机器学习/深度学习/神经网络基础,熟悉 PyTorch 的基本使用,能够独立完成模型的前向/反向训练流程。
5、具备良好的学习能力、问题分析能力和团队协作精神,对 AI Infra 方向有浓厚兴趣。

具备以下条件者优先:

1、了解分布式训练、TP/CP/EP/DP/PP 等并行场景,有 PyTorch 原生分布式训练或 Megatron-LM、DeepSpeed 等训练框架使用经验。
2、了解 Transformer 类大模型或 DiT 类多模态模型架构,有相关训练实验或经验。
3、有 AI Infra 方向的科研/实习经历,或参与过相关开源项目、相关学科竞赛(如 ACM、超算竞赛等)。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →