岗位描述
岗位职责
- 模型接入与服务化:对接算法及训练团队,完成模型加载、输入输出适配、预处理与后处理、接口封装及运行环境管理,建立规范的模型接入流程。
- 推理服务建设:开发模型部署、服务启停、健康检查、版本切换及回滚能力,支持模型 API、请求路由、并发控制、超时处理与异常恢复。
- 平台后端研发:建设模型注册、部署管理、任务管理、状态查询及权限管理等后端模块,为平台控制台及外部调用提供清晰、稳定的 API。
- 训练与评测流程对接:对接数据、训练和评测系统,完成任务触发、状态同步、模型产物流转及结果记录,支撑后训练到部署推理的流程贯通。
- 性能与稳定性优化:分析模型加载时间、推理时延、吞吐、显存及资源利用率,定位服务与模型运行中的性能瓶颈;完善日志、指标、告警及故障诊断能力。
- 部署与私有化交付:参与容器化打包、离线安装、环境适配、升级回滚及客户环境联调,沉淀部署文档、接口说明和排障手册。
- 工程质量建设:与前端及测试同事完成接口联调、自动化测试和版本验收,保障核心链路的正确性、可维护性和交付质量。
岗位要求
- 3 年以上后端、AI 应用基础设施或模型服务研发经验,有独立负责模块设计、开发、上线及维护的经历。
- 熟练使用 Python,掌握 Go、Java、C++ 等至少一种语言者优先;具备良好的代码设计、调试和工程实践能力。
- 熟悉 HTTP / RPC、数据库、缓存、消息队列及异步任务等常见后端技术,能够设计可靠的服务接口、任务状态流转和异常处理机制。
- 对现代深度学习有一定理解:了解 Transformer、Attention、Embedding 等常见概念,理解训练与推理的区别,以及模型权重、精度、上下文长度、批处理等因素对推理效果和资源消耗的影响。
- 熟悉 PyTorch 基本使用,能够阅读模型加载与推理代码,理解张量维度、数据类型、设备分配及前后处理逻辑,定位常见的依赖、显存和输入输出问题。
- 有模型部署或推理服务实践,使用过至少一种推理引擎、模型服务框架或基于 PyTorch 自建的服务方案,能够根据模型特点选择合适的部署方式。
- 熟悉 Linux、Docker 和基本的 GPU 运行环境,了解 Kubernetes 的部署与资源管理方式,具备日志分析、性能排查及服务故障定位能力。
- 具备良好的协作意识,能够与算法、训练工程、前端及测试同事明确接口、推进联调,并对负责模块的交付结果负责。
加分项
- 有 VLM / VLA、多模态模型、机器人模型或具身智能相关工程经验。
- 使用过 Triton Inference Server、vLLM、SGLang、TensorRT、ONNX Runtime 等工具,并理解其适用场景。
- 有动态批处理、流式推理、模型量化、多模型部署或 GPU 资源管理经验。
- 有训练平台、评测平台、模型注册与实验管理系统的研发经验。
- 有私有化、离线环境、异构硬件部署或客户现场问题排查经验。
- 有 CUDA、算子优化、模型编译或分布式推理经验。