锦鲤求职

燧原科技

【2027校招】大模型训练算法工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

团队介绍:

燧原科技软件部门大模型训练算法团队致力于支撑公司训练业务在自研GCU硬件集群上落地,根据业界主流模型和框架制定模型算法方案、分布式策略、算子融合调优、精度收敛验证等方案,保障大模型训练业务的部署。团队不仅关注模型效果,更致力于在自研GCU集群上实现高效、稳定的大规模训练。通过软硬件协同设计,解决显存墙、通信墙、算子效率等实际问题,为客户提供极致性价比的训练方案。与此同时,团队也关注业界先进算法与技术的发展趋势,探索出适合自研硬件的技术路线。

Base:

上海/北京/南京/杭州

岗位职责:

1.负责大模型在自研GCU集群上的预训练、指令微调、RLHF全流程落地,包括模型迁移与适配、分布式策略制定、精度对齐与收敛性验证

2.针对GCU硬件特性,设计并实现算子融合、通信隐藏、混合精度策略等性能优化方案,提升训练吞吐并降低显存占用

3.参与大规模分布式训练的稳定性与性能调优,定位并解决通信瓶颈、计算不均、梯度爆炸等实际工程问题

4.与框架、算子、集合通信等团队协作,推动新算子开发、显存优化、调度策略改进,以支持前沿模型结构

5.跟踪业界大模型训练技术,在GCU上实现并验证SOTA方案

基本要求:

1.计算机科学、人工智能或相关专业本科及以上学历,对大模型训练、深度学习或高性能计算等相关领域有一定了解

2.熟悉PyTorch框架,精通C++和Python编程

3.熟悉至少一种主流训练框架(如DeepSpeed、Megatron-LM、torchtitan)的内部原理

4.熟悉分布式策略和通信过程

5.具备良好的英文技术文档阅读能力

加分项:

1.有大模型训练部署或完整模型性能分析优化经验者优先

2.有大模型训练精度调试经验者优先

3.熟悉至少一种强化学习框架的内部原理,了解经典强化学习算法者优先

4.了解AI芯片体系结构、算子计算原理或通信库底层实现者优先

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →