岗位描述
工作内容
1. 熟练算力底座工具链,可独立搭建 GPU/NPU 异构集群运行环境,完成环境部署、版本治理、线上故障排查;
2. 能独立完成单卡 / 单机多卡 LLM 部署,量化验证,ATC 模型转换、量化精度验证;
3. 熟练性能采集分析工具: 能够开展基础性能分析,落地常规优化:算子融合、KV Cache 量化、张量并行 / 流水线并行参数调优;
4. 能够部署主流推理服务(vLLM / TensorRT-LLM /vLLM-Ascend/ MindSpore 推理),实施压力测试,采集时延、吞吐指标,输出性能优化报告;
5. 具备独立开发自定义底层算子能力;遇到算子性能缺陷、算子缺失问题,能够完整整理复现环境、性能日志、模型样本,协同相关团队推进优化
任职条件
熟练掌握华为昇腾Ascend、CANN工具链者优先;精通Linux操作系统、Docker容器部署与运维,熟练掌握PyTorch、模型量化、推理框架、服务器运维、资源监控等相关技能;