岗位描述
岗位职责
1、参与语言及多模态大模型训练框架的核心功能开发,覆盖预训练与后训练全流程,保障系统稳定高效运行;
2、持续扩展框架功能与计算能力,优化系统架构与模型设计,保持技术方案的前瞻性与业务适配性;
3、负责大模型训练前沿优化技术的研究与落地,涵盖通信、计算、数据流水线及任务调度等关键方向,并主导相关架构设计;
4、定位并解决训练过程中的系统性能瓶颈,持续提升训练吞吐与效率;
5、推进低精度训练(如混合精度、量化等)的性能优化,并支撑业务场景落地。
岗位要求
1、2027届本科及以上学历,计算机、软件工程、人工智能等相关专业;
2、深入理解大模型预训练原理,熟悉 Transformer 架构及主流大模型(如 GPT、LLaMA 等)的训练流程;
3、掌握分布式训练体系,熟悉 Megatron-LM、FSDP 等主流分布式框架的实现机制;
4、了解现代 GPU 集群通信拓扑及 NCCL 等通信库的工作原理;
5、了解 GPU 并行计算与异构计算的基本概念与常见优化手段;
6、具备良好的沟通表达能力和高度的责任心,工作严谨务实。
加分项:
1、对 AI 技术有浓厚兴趣,思维活跃,乐于探索新方向,善于直击问题本质,具备较强的自驱力与批判性思维。