岗位描述
岗位职责
1. AI软件栈架构设计与演进:制定江原NPU的AI软件栈整体技术蓝图,明确算子库、编译器(Triton)、框架适配层的模块划分与接口规范。根据芯片架构演进路线图(D10→D20及后续),前瞻性规划软件架构的升级路径,平衡性能、通用性、可维护性。
2. 算子库架构方案设计:设计算子库的分层架构(基础算子→复合算子→融合算子),定义算子开发规范、性能验收标准与自动化测试方案。主导关键算子(Conv、GEMM、Attention等)的性能建模与优化策略,确保算子性能达到硬件峰值算力的特定比例(如80%+)。
3. AI编译器技术方案:设计基于Triton的编译器后端架构,制定图优化Pass序列、内存复用策略、代码生成模板等核心方案。决策编译器与算子库的分工边界(例如:是否采用算子外包调用 vs 直接生成硬件指令)。
4. 框架集成方案设计:设计PyTorch接入方案(如通过Custom Device接口或PrivateUse1机制),包括张量迁移、自动微分适配、分布式支持等。为大模型推理场景设计vLLM/SGLang的NPU后端方案,制定显存管理、请求调度、连续批处理的适配策略。
5. 架构落地与推进:输出架构设计文档、技术原型和演进Roadmap,组织技术评审并推动团队按方案实施。识别落地过程中的技术风险(如性能回退、接口不兼容),制定缓解措施并协调资源解决。
任职要求
必选项:计算机相关专业硕士及以上学历,8年以上AI软件系统经验,其中至少3年担任架构师或技术Leader角色。具备完整的方案设计→原型验证→量产交付的架构落地经验(不限于NPU,GPU/TPU/DSP亦可)。
算子层:精通至少一种AI芯片的算子开发全流程(从算法分析→指令调优→性能验收),并有主导设计算子库分层架构的案例。
编译器层:深入理解至少一种AI编译器(Triton/TVM/MLIR/XLA)的架构设计,独立完成过编译器后端模块(如Pass、Codegen、Runtime)的方案设计。
框架层:熟悉PyTorch内部机制(Dispatcher、Autograd、DDP),主导过至少一个框架后端适配方案的设计(如PrivateUse1扩展、第三方设备接入)。
优秀的系统抽象能力和技术决策能力,能权衡多种技术方案的优劣并给出合理选型。
具备跨团队推动能力(与硬件、驱动、算法团队协作),将架构方案转化为可执行的开发任务。
其他
有Triton编译器贡献或二次开发经验。
熟悉vLLM/SGLang等推理框架的内部架构,有自定义设备后端接入经验。
参与过芯片流片前的软件仿真环境设计。