岗位描述
工作职责
1、算子极致优化:负责壁仞 GPGPU 平台上深度学习核心算子(如 GEMM、Attention、LayerNorm 等)的设计、开发与极致性能调优,深入挖掘硬件算力极限,满足训练与推理场景下的高性能与低延迟需求;
2、微架构级性能突破:深入分析壁仞新一代 GPGPU 架构特性,基于底层编程模型(如指令级编程、内存层级优化、数据排布重构等)进行算子微架构级调优,突破访存与计算瓶颈;
3、开源生态与社区贡献:积极参与并主导壁仞 GPGPU 开源软件栈及算子生态建设,将高性能算子优化方案与工程实践回馈开源社区;负责解决社区用户在算子适配与性能调优方面的关键 Issue,提升壁仞开源平台的开发者体验与行业影响力;
4、性能分析与前沿探索:利用 Profiling 工具精准定位端到端模型的性能瓶颈,制定并落地专项算子优化方案;同时探索并实践前沿计算范式(如 FlashAttention、混合精度、稀疏计算等),为新架构的性能突破提供关键技术支撑。
职位要求
1、计算机科学、电子工程、自动化或相关专业,硕士及以上学历,具备扎实的计算机理论基础;
2、精通 Python、C/C++,熟悉 Linux 开发环境,具备良好的编程习惯和工程化能力,掌握常用数据结构与算法;
3、熟悉深度学习原理与主流模型架构(如 CNN、Transformer、RNN 等),了解主流框架生态(PyTorch/TensorFlow 等)及社区技术动态,有实际项目经验者优先;
4、熟悉 CUDA 编程模型,具备高性能计算(HPC)或 GPGPU 算子开发经验,有算子优化(如融合、量化、内存优化等)实践经验者优先;
5、具备良好的沟通协作能力、问题分析能力与自主驱动力,对底层性能优化有强烈兴趣,乐于挑战技术难题。