岗位描述
岗位职责
1.在 TB/s 级的海量连续数据流下,实现复杂物理模型与深度学习算法的硬实时(Hard Real-time)处理;
2.突破“内存墙(Memory Wall)”瓶颈,深度剖析算法在 CPU / GPU /FPGA/ DSP 上的访存行为,进行 L1/L2 Cache 层级的极致指令级优化;
3.负责大规模三维体数据(3D Voxel)处理算法的并行化改造与 TensorRT/CUDA 底层算子(Kernel)开发。
岗位要求
1.计算机体系结构、微电子、高性能计算相关专业,博士优先;
2.极强的 C/C++ 功底,精通 CUDA 编程与 GPU 架构(了解 Warp, Shared Memory, Bank Conflict 等底层机制);
3.有深入优化过大型科学计算开源库,或熟悉 RDMA、GPUDirect Storage 等高速数据传输技术者优先。