锦鲤求职

绿盟科技

AI Infra 工程师(研发效能方向)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责

1. 负责面向内部研发团队的 AI Infra 建设,承担本地大模型推理服务的架构设计、部署、性能优化和稳定运行,为规模化 AI Coding 提供基础支撑。

2. 建设和优化 GPU、Kubernetes、模型推理框架及 AI 网关能力,解决模型接入、资源调度、弹性扩缩、限流配额、可观测性和成本控制等问题。

3. 深入研发流程,将 AI Coding、智能代码审查、自动化测试、问题诊断等能力与现有研发工具链和 DevOps 平台集成。

4. 建设模型服务和研发平台的 CI/CD、自动化测试、发布门禁、灰度及回退能力,提升交付效率和系统质量。

5. 建立模型效果、推理性能和平台运营指标,通过数据持续优化模型服务、研发流程和开发者体验。

任职要求

1. 计算机相关专业本科及以上学历,具备 3 年及以上 AI Infra、平台工程、DevOps、SRE 或相关研发经验。

2. 具备大模型本地化推理部署的实际项目经验,能够独立完成模型部署、性能测试、容量评估和运行问题排查。

3. 熟悉 vLLM、SGLang、TGI、TensorRT-LLM 等至少一种模型推理框架,了解并发、批处理、KV Cache、量化、显存占用、吞吐和时延等关键因素。

4. 熟悉 NVIDIA GPU、Linux、Docker 和 Kubernetes,具备 GPU 资源调度、容器化部署和模型服务运维经验。

5. 熟练掌握 Python、Go 或 C++ 中至少一种语言,具备平台功能和自动化工具的实际开发能力。

6. 熟悉 GitLab、CI/CD、监控告警和自动化发布等 DevOps 工具链,能够推动研发流程标准化和平台化。

7. 具备较强的问题分析和工程落地能力,能够从研发实际痛点出发推动方案实施,并对最终效果负责。

优先考虑

- 有企业内部 AI Coding 或大模型私有化部署经验。

- 有多 GPU、多节点推理服务或 GPU 集群建设经验。

- 有 AI 网关、模型路由、Token 限流、配额及成本治理经验。

- 有模型评测、推理压测、容量规划和性能优化经验。

- 有研发效能平台、开发者平台或大型 DevOps 平台建设经验。

- 有 Prometheus、Grafana、OpenTelemetry、DCGM 等可观测性实践。

- 有智能代码审查、自动化测试、问题诊断等 AI 研发效能工具建设经验。

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →