岗位描述
岗位职责
岗位职责:
1、面向 AI 行业应用和高性能计算场景,支持用户在使用集群、平台、模型和工具链过程中遇到的技术问题。
2、参与用户应用、训练/推理任务、系统环境和平台组件的调试,协助定位功能、性能和稳定性问题。
3、梳理客户训练、推理和行业应用场景,沉淀 SLA、功能验证、性能测试和使用体验需求。
4、基于 profiling、日志、监控和压测数据,分析应用性能瓶颈,输出评估报告、优化建议和问题复盘。
5、参与高性能计算集群用户环境、应用适配工具、FAQ、workaround 和知识库的建设与维护。
岗位要求
任职资格:
1、计算机、人工智能、软件工程、自动化、数学等相关专业,硕士优先。
2、熟悉 Linux、Python 或 Shell,具备基本的问题排查、脚本开发和数据分析能力。
3、理解 AI 应用、模型训练/推理、高性能计算或分布式系统基础概念。
4、了解常见性能指标,如吞吐、延迟、资源利用率、显存/内存占用和稳定性等。
5、具备良好的沟通能力、服务意识和文档沉淀能力,能够推动问题从发现到闭环。
加分项:
1、使用过 PyTorch、Transformers、vLLM、SGLang、DeepSpeed、Slurm、Kubernetes 等框架或平台。
2、了解 GPU、CUDA、NCCL、MPI、存储和网络等集群基础组件。
9、有 AI 应用开发、模型部署、性能分析、HPC 集群使用或开源项目经验。