锦鲤求职

晶晨股份

AI Infra 资深工程师(J11720)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
岗位职责:
1. 负责 GPU 服务器集群的搭建、监控、日常运维、故障处理,管理多卡算力资源,保障集群稳定;
2. 本地私有化部署开源大模型,搭建推理、微调环境,使用 vLLM 等框架做推理服务,进行量化、并行性能调优;
3. 维护 Linux、CUDA、Docker 环境,使用 Slurm/K8s 做算力调度,编写运维 SOP 和部署文档;
4. 和算法团队配合,解决训练、推理阶段底层算力和环境问题,规划算力扩容。

岗位要求
任职要求:
1. 3 年以上 GPU 集群运维 + 大模型本地部署经验;精通 Linux、Docker;熟悉 CUDA、NCCL;
2. 熟悉 Slurm 或 K8s 算力调度,熟悉 GPU 监控,能排查硬件、网络、显存故障;
3. 实战落地过本地大模型推理,掌握模型量化、推理加速;有 LoRA 微调环境搭建经验优先;
4. 能写 Shell/Python 脚本,具备独立问题排查能力。

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →