岗位描述
岗位职责:
1. 在沐曦GPU平台设计并实现高性能、高精度的BLAS库函数,重点优化GEMM、GEMV等核心算子;
2. 深入分析GPU硬件架构(如Tensor Core、内存层次结构),开发面向沐曦GPU架构的优化方案;
3. 负责GPU高性能编程平台的构建,包括C/C++ Programming和Pythonic Programming的平台,使能用户开发高性能应用;
4. 与硬件架构师和驱动团队协作,实现硬件特性的软件层高效利用;
5. 开发和维护测试框架,确保数值精度、性能稳定性和跨平台兼容性;
6. 跟踪学术界和工业界最新进展,将先进算法转化为产品级解决方案;
7. 支持流行的AI框架,如Pytorch/Tensorflow/SGLang/VLLM等;
8. 支持流行的开源科学计算应用(数学,物理,化学,医药等),工程仿真,预测预报等;
9. 编写技术文档,支持内部客户和合作伙伴集成与调优。
岗位要求:
1. 熟悉并掌握并行编程相关技巧,了解并行计算硬件体系结构;
2. 至少3年C++编程经验;
3. 具有CUDA, ROCM, OpenCL相关开发经验者优先;
4. 熟悉浮点运算和数值稳定性分析,有BLAS/LAPACK等库开发经验者优先;
5. 熟悉GPU性能分析工具,掌握汇编级优化或 intrinsic 编程经验者优先。