岗位描述
1.硕士及以上学历,计算机相关专业毕业;
2.至少5-10年智算基础设施架构设计及实施经验。了解大模型训练推理对算力基础设施的技术需求,在高性能计算、大规模集群调度等方面有丰富经验;
3.熟悉国产AI芯片(昇腾/寒武纪/海光等)的技术特性、组网方案及适用场景,具备千卡级集群架构规划能力
4.至少需具备3-5年大模型训练或推理平台架构设计经验,熟悉主流训练框架(PyTorch、MindSpeed、Megatron-LM等)及推理优化技术和相关引擎(量化、剪枝、蒸馏、vLLM、算子优化等);
5.精通并行计算与性能优化技术,包括数据并行、张量并行、流水线并行、序列并行等策略,具备MFU(模型算力利用率)优化实战经验;
6.熟悉智算中心基础设施,包括液冷散热方案、高功率机柜设计、能效管理(PUE优化)等,具有3-5个智算中心建设实施经验者优先;
7.具备良好的沟通能力、独立分析能力、团队协作精神,态度积极主动、有服务意识和责任心。