锦鲤求职

声网

AI模型服务化工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

该岗位负责算法模型从交付到生产运行的工程化闭环。与算法团队协作,将大语言模型,Embedding 模型,Rerank 模型,计算机视觉模型,语音模型以及传统机器学习模型,部署为标准化的 CPU 或 GPU 在线推理服务。核心目标不是创造新算法,而是让模型服务具备可靠性,性能,扩展性,可观测性和成本效率。

我们不要求你训练出更聪明的模型,我们需要你让模型稳定地服务真实用户。

岗位职责:

1. 模型服务化与标准接入:

- 建立模型交付规范,覆盖模型文件,运行环境,配置参数,前后处理,接口协议,健康检查,版本信息与验收标准;

- 根据模型类型选择合适的推理运行时,基于 vLLM,NVIDIA Triton Inference Server,ONNX Runtime,PyTorch 或其他框架,将 CPU 与 GPU 模型封装为可复用的在线服务;

- 支持 HTTP,gRPC,SSE 流式响应,同步与异步调用,并推动接口,错误码和异常处理标准化;

2. 推理性能与资源效率:

- 建立统一的压测方法,持续分析吞吐量,并发量,P50,P95,P99 延迟,CPU 利用率,GPU 利用率,内存与显存占用;

- 针对 GPU 模型优化批处理,并发控制,KV Cache,多卡运行与实例配置。针对 CPU 模型优化线程池,批处理,内存分配,NUMA,CPU 亲和性与并行策略;

- 在性能目标与基础设施成本之间做工程权衡,输出可复现的性能基线,容量结论与配置建议;

3. 容器化与云原生部署:

- 负责 Docker 或 OCI 容器化,并在 Kubernetes 环境中完成部署,配置与运行;

- 建设 CPU 与 GPU 资源申请,调度,隔离,弹性扩缩,滚动发布,灰度发布,预热,故障恢复与快速回滚机制;

- 处理模型启动时间长,节点资源异构,驱动或运行时兼容,资源碎片与实例冷启动等生产问题;

4. 流量入口与服务治理

- 设计并维护 API Gateway 或 Proxy 层,使用 Nginx,Envoy,Kong,Higress 或同类组件实现服务发现与流量路由;

- 实现认证,租户隔离,配额,限流,负载均衡,超时,重试,熔断,背压与连接管理;

- 正确处理流式输出,长连接,客户端断开,大请求体,超长输入与突发流量;

5. 可观测性与生产稳定性

- 建设日志,指标,链路追踪,告警与运行看板,形成客户端,代理层,应用层,推理框架,容器,操作系统与硬件的端到端可观测性;

- 制定并维护 SLI,SLO 与容量水位,定位 CPU 饱和,GPU OOM,CUDA 错误,模型加载失败,请求排队,延迟抖动与网络中断等问题;

- 参与生产故障处理,根因分析与改进闭环,持续降低故障恢复时间;

6. 发布流程与平台化能力

- 建设模型服务 CI/CD,确保模型版本,镜像版本,配置版本与部署版本可追溯;

- 开发模型接入模板,自动部署,自动压测,自动验收与自动回滚能力,降低算法团队的上线成本;

- 沉淀 Helm Chart,SDK,CLI,Operator 或内部平台能力,推动模型服务从项目制交付演进为平台化交付;

7. 容量规划与成本管理

- 基于模型特性与业务流量完成容量评估,资源规划,峰值保护与扩容预案;

- 建立模型,租户与业务维度的 CPU,GPU,内存,显存与请求成本统计;

- 优化资源空闲率,资源碎片与过度预留,在服务等级与成本之间取得可解释的平衡;

8. 跨团队协作

- 与算法团队共同定义模型交付规范,明确模型文件,依赖,接口,资源需求与验收条件;

- 与后端,平台,SRE,安全及业务团队协作,确定接口协议,服务等级,容量目标与上线流程;

- 推动模型从开发环境可运行,升级为能够持续稳定对外提供服务。

岗位要求:

1. 具备 3 年及以上后端工程,云平台,基础设施,MLOps,ML Systems 或模型服务化相关经验。能力突出

者不受年限限制;

2. 熟悉 Python,Go,Rust,C/C++ 中的一种即可,能够使用所选语言开发可维护的生产级服务与工程工

具;

3. 熟悉 Linux,Docker,Kubernetes,理解容器生命周期,资源 requests 与 limits,健康检查,Service,Ingress,Deployment,HPA 等机制;

4. 具备 vLLM,NVIDIA Triton Inference Server 或同类推理框架的实际部署经验,能够解释框架选择与参数配置的工程依据;

5. 理解 CPU 与 GPU 推理的基础运行机制,包括线程与进程模型,内存与显存,批处理,并发控制,模型加载,驱动与运行时兼容;

6. 熟悉 HTTP,gRPC,SSE,DNS,TCP,TLS,反向代理与负载均衡等基础知识;

7. 能够独立进行性能压测,容量评估与瓶颈分析,并使用数据解释吞吐量,延迟,并发量,资源利用率与成本之间的关系;

8. 熟悉 Prometheus,Grafana,OpenTelemetry,Loki,Elasticsearch 或类似可观测性工具;

9. 具备生产环境故障排查能力,能够跨客户端,代理,应用,容器,操作系统与硬件层定位问题;

10. 具备清晰的文档能力与跨团队协作能力,能够把一次性上线经验沉淀为标准,工具和平台能力;

加分项:

- 有大规模 LLM 推理服务,多租户模型平台或统一模型网关建设经验;

- 熟悉 TensorRT-LLM,TGI,KServe,Ray Serve,Seldon,BentoML 或其他相关框架;

- 有 CPU 推理优化经验,熟悉 ONNX Runtime,OpenVINO,SIMD,NUMA,线程亲和性,量化或模型裁剪;

- 有多机多卡,NCCL,RDMA,InfiniBand,GPUDirect 或 MIG 使用经验;

- 熟悉 Helm,Argo CD,Terraform,GitOps 或 Kubernetes Operator 开发;

- 有高并发 API,长连接,流式响应系统或高性能网关的设计经验;

- 有公有云或私有云异构计算集群建设经验,理解 CPU 与 GPU 资源池的调度与成本模型;

- 有资源计量,租户计费,成本归集或 FinOps 相关经验;

核心衡量指标:

- 模型上线效率:模型从算法交付到生产可用的周期,接入步骤的标准化程度与自动化比例;

- 服务可靠性:服务可用性,SLO 达成率,生产事故数量,故障恢复时间与回滚效率;

- 性能表现:P95 与 P99 延迟,稳定并发量,吞吐量。对大语言模型,还包括首 Token 延迟与单 Token 生成延迟;

- 资源与成本:CPU 利用率,GPU 利用率,内存与显存利用率,单请求或每百万 Token 的推理成本;

- 交付质量:发布成功率,容量评估准确度,性能基线完整度与问题复现效率;

岗位边界:

- 本岗位不以预训练,微调,强化学习,模型结构研究或算法指标提升为主要职责;

- 本岗位不以数据清洗,数据标注,特征工程或训练集构建为主要职责;

- 不要求候选人创造新算法,但需要理解模型的推理特性,并能与算法团队共同定义可上线,可运行,可验收的交付标准;

- 岗位对模型上线后的可靠性,性能,扩展性,可观测性与运行成本承担主要工程责任。

后端开发方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →