岗位描述
岗位职责
工作职责
1.架构阶段:基于对未来HPC/AI负载的理解,通过性能模拟为网络和交换芯片设计提供关键参数建议(如内存带宽与计算单元比例、专用端网协同支持等)。
2.开发阶段:与芯片团队合作,在FPGA或虚拟仿真平台上运行典型负载,通过全栈性能剖析,定位网络性能瓶颈根因。
3.部署阶段:在真实集群上对HPC、AI训练/推理任务进行压力测试与调优,暴露极端规模下的系统性瓶颈(如硬件同步原语开销、长期高负载稳定性问题),为下一代芯片设计提供数据输入。
岗位要求
任职资格
1. 硕士及以上学历,计算机、通信、电子信息、软件工程、数据科学、人工智能等相关专业。
2.熟悉Linux内核、网络(InfiniBand/RoCE)及存储系统原理。
3.编程能力:扎实的Python/C++能力,熟悉CUDA编程模型,能编写分析脚本和工具。
4.熟悉至少一种主流大模型架构,了解完整推理流程。
5.熟悉AI分布式训练/推理原理(数据/模型/流水线并行)及常见通信模式。