锦鲤求职

鸿钧微电子

IT AI Infra工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

1.AI推理平台规划与建设:负责AI推理平台的架构规划、技术选型、建设与持续演进,支撑大模型推理服务的规模化部署与服务化运营;负责AI应用(如Ollama、vLLM、PyTorch等)的私有化部署与上线交付;

2.推理服务运营保障:负责推理服务的部署上线、版本管理、容量伸缩与高可用保障,建立吞吐、时延、GPU利用率等核心指标基线,达成研发部门SLA服务承诺;

3.AI算力及HPC集群运维:负责AI底层架构运维,统筹LSF作业调度系统全生命周期管理,完成系统规划、部署、性能调优、故障排查及集群容量规划;

4.算力资源调度与优化:负责GPU/CPU/存储等算力资源的统一调度与池化管理,通过GPU切分共享、调度策略优化等手段持续提升资源利用率、降低单位算力成本;

5.Linux系统全维度运维:熟练掌握主流Linux发行版(CentOS 7/8、Ubuntu、Rocky等)的部署、运维、升级、故障排查,精通系统权限、服务、进程、日志、磁盘等管理;

6.监控、备份与自动化运维:基于Zabbix、Prometheus、Grafana搭建及优化全维度监控告警体系,实现故障事前预警;负责Veeam等备份系统运维与方案优化;

7.AI基础设施综合运维支撑:能够独立完成AI基础设施相关的其他运维、支撑及优化工作。

任职要求:

1.本科及以上学历,计算机、软件工程、电子信息等相关专业;5年以上IT基础设施运维经验,其中2年以上AI平台建设与运营经验,具备AI平台建设经验;

2.熟悉AI Infra基础架构,了解AI算力集群、GPU集群运行逻辑。了解大模型推理服务技术栈(vLLM、TensorRT-LLM、Triton Inference Server等),具备推理框架部署、调优与服务化运营经验,了解模型量化、批处理调度等推理优化手段;

3.精通LDAP、DNS等通用基础服务搭建与运维,具备高可用架构维护经验;

4.精通Linux系统管理及Python/Shell脚本开发,具备运维自动化落地经验,有软件项目开发经验优先;

5.有芯片设计企业的AI平台(AI算力平台、推理平台、AI for EDA平台等)建设与运营经验优先;

6.熟练使用Zabbix、Prometheus、Grafana搭建监控告警平台,熟悉Veeam等主流备份软件运维;

7.具备良好的服务态度和沟通能力,积极主动,责任心强,安全意识好,有较好的抗压能力,有很好的技术敏感度和风险识别能力,具备良好的沟通技巧和团队合作能力;

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →