锦鲤求职

燧原科技

【2027校招】AI框架软件开发工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

团队介绍:

燧原科技软件部门AI框架团队致力于构建AI模型与自研芯片之间的核心桥梁,专注于AI框架与硬件的协同优化。我们深入PyTorch等主流框架底层,依托Dispatcher等核心机制,将SGLang、vLLM、Megatron等应用框架无缝接入自研GCU硬件,并扩展至分布式场景。通过框架层特性优化,我们针对不同业务场景与模型开展功能调试、性能优化,降低使用门槛的同时,提升GCU芯片的显存利用率和计算性能。同时,我们支持多种分布式推理和训练并行策略,持续优化GCU在多卡、多节点环境下的扩展性与效率。

Base:

上海/北京/南京

岗位职责:

1.深入参与PyTorch主流AI框架的底层开发,将Aten算子高效映射并部署到自研GCU硬件上,并参与PyTorch官方生态库(如torchtitan、torchvision及torchlighting等)在GCU上的部署实现

2.负责将SGLang、vLLM、Megatron等高性能训练推理框架与GCU硬件进行集成和打通,针对大语言模型(LLM)等场景进行深度性能调优和功能增强。包括但不限于计算内核优化、内存管理与优化、调度策略改进等,极致提升GCU的利用率和性能表现。

3.参与设计和开发支持GCU硬件的分布式训练与推理框架,支持数据并行、模型并行、流水线并行等多种并行策略,优化多卡和多节点的扩展性与效率。

4.与硬件、编译器、驱动团队紧密合作,进行软硬件协同设计,支持客户等解决框架层的技术问题。

基本要求:

1.计算机科学、人工智能或相关专业本科及以上学历,对AI框架、深度学习或高性能计算(HPC)等相关领域有一定认知和了解

2.精通C++和Python编程,具备良好的软件工程能力、代码风格和调试技巧

3.有Pytorch框架用户使用经验,关注Pytorch社区信息以及演进;

4.了解大模型分布式常见分布式策略

5.具备良好的英文技术文档阅读能力

进阶要求:

1.有大语言模型(LLM)推理框架(如vLLM等)或服务框架(如SGLang)的开发或优化经验者优先

2.有大规模分布式训练(如DeepSpeed, FSDP, Megatron-LM)或推理的实践经验,理解其底层通信和并行原理

3.熟悉编译器技术(如MLIR, LLVM, TVM)或计算图优化(Graph Optimization)技术者优先

后端开发方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →