岗位描述
岗位职责:
1. 负责 GPGPU 性能分析工具的核心研发,包括但不限于硬件计数器采集、内核执行轨迹追踪、内存访问剖析等功能,助力用户定位计算瓶颈(类似 Nsight Compute)。
2. 开发系统级 GPGPU 监控工具,实现多卡 / 多节点场景下的设备状态(功耗、温度、利用率)、进程调度、通信链路(PCIe/NVLink)的实时监控与日志分析(类似 Nsight Systems)。
3. 设计 GPGPU 设备管理工具,支持设备枚举、算力分配、电源控制、固件升级、错误诊断等基础管理功能(类似 nvidia-smi)。
4. 对接 GPGPU 硬件接口(如 PCIe 配置空间、设备寄存器)、驱动 API 及内核模块,实现工具与硬件 / 系统的高效交互。
5. 优化工具的采集精度、 overhead(性能损耗)及易用性,解决大规模部署下的兼容性、稳定性问题。
6. 与算法团队、硬件团队、驱动团队协作,理解业务场景需求,将工具能力嵌入用户开发、调试、运维流程。
任职要求:
1. 本科及以上学历;计算机、信息、通信、自动化、电子、数学等相关专业;
2. 有 Nsight Compute/Nsight Systems/nvidia-smi 等同类工具开发或二次开发经验者优先;
3. 熟悉 GPGPU 硬件计数器编程(如 NVIDIA PerfWorks、AMD ROCm Profiler 接口)者优先。;
4. 具备分布式系统监控工具开发经验(如多节点 GPGPU 集群监控)者优先;
5. 有开源性能分析工具(如 perf、gprof、bpftrace)贡献经验者优先。;
6. 熟悉 Python/Shell 脚本开发,能快速实现工具自动化测试与部署者优先;
7. 熟悉IDE开发的优先;