岗位描述
岗位职责:
1、负责大模型在算力平台上的训练、推理性能优化,持续提升模型在异构硬件环境下的吞吐、时延、显存占用和资源利用率等核心指标;
2、负责算力平台下训推框架的端到端性能分析与性能瓶颈定位;
3、负责算力平台下的分布式训练与推理场景下的性能优化,包括通信库优化、KV cache传输效率优化等;
4、开发性能分析、精度评测和芯片评测等工具,持续跟踪大模型、AI芯片和AI Infra发展趋势,支撑技术规划与能力演进。
任职要求:
1、本科及以上学历,计算机、软件工程、电子、通信、自动化等相关专业,具备扎实的数据结构、算法、操作系统、计算机体系结构和网络基础优先;
2、精通Transformer模型架构,熟悉常见算子的实现原理,如flash attention、fused moe等优先;
3、熟悉异构算力平台特性,能熟练使用性能分析工具定位性能瓶颈优先;
4、具备良好的 C++、Python工程能力和性能分析能力,能够独立定位复杂问题并推动优化方案落地优先。