岗位描述
岗位职责
负责计算 GPU 核心计算架构的整体设计与定义,涵盖 SIMD/SIMT 执行管线、指令调度与发射(Issue/Dispatch/Scheduler)、寄存器堆与操作数收集(Operand Collector)、Load/Store 与访存管线、分支处理与 Divergence 管理等核心机制;
制定计算核心的微架构规格(Micro-architecture Spec),针对 AI 训练/推理(Tensor Core/矩阵计算、低精度数据类型 FP8/FP16/BF16/INT8)与通用计算(GPGPU)负载,优化吞吐、延迟隐藏与能效(PPA 权衡);
主导计算核心性能建模与架构探索(C++/SystemC 等),分析典型 AI/HPC workload 特征(算子级/内核级),为流水线深度、发射宽度、寄存器堆容量与 bank 配置、队列深度等关键参数提供量化决策依据;
定义指令集与软硬件接口:与编译器团队协作,设计 ISA、 warp/wavefront 调度语义、特殊函数与矩阵指令扩展,保障编译器高效映射;
与 RTL 设计、验证、编译器及驱动软件团队紧密协作,推进架构落地,参与设计评审并把控实现与架构一致性;
跟踪计算架构技术演进(稀疏计算、脉动阵列、存算一体、新精度格式等),制定计算核心的差异化技术路线图。
任职要求
微电子、计算机、电子工程等相关专业,本科及以上学历,其中 3 年以上芯片架构/设计经验, GPU/NPU 计算核心相关经验;
精通 GPU/SIMT 计算架构原理:指令调度、寄存器堆组织、Divergence 处理、延迟隐藏、多线程交错执行机制;
深入理解 AI 计算负载特征(Transformer/Conv/MatMul 算子、低精度数据格式、稀疏化),有 Tensor Core 或矩阵计算单元设计经验者优先;
熟悉 GPU 软硬件栈:ISA 设计、编译器后端(指令调度/寄存器分配)、CUDA/OpenCL 类编程模型的理解;
熟练使用 C/C++(SystemC 经验优先),具备性能建模与架构探索能力;
熟悉 AMBA 总线协议(AXI/ACE)及 Cache/MMU 等存储子系统者优先;
良好的英文文档读写能力,能独立撰写架构规格文档;沟通协作能力强,具备跨团队(架构/RTL/DV/编译器)协作经验。
加分项
有主流或自研 GPU/NPU 计算核心(NVIDIA/AMD/ARM Mali/自研 IP)架构或设计经验;
有 Tensor Core/脉动阵列/矩阵乘单元的微架构设计经验;
有 GPGPU-Sim/Accel-Sim 等模拟器开发或扩展经验;
有 CUDA kernel 编写与性能调优经验,理解软件视角的硬件瓶颈;
有功耗建模、能效优化经验;
有顶会论文(ISCA/MICRO/HPCA/DAC)或核心专利。