岗位描述
工作内容
1、负责开源大语言模型(DeepSeek、GLM系列等)及智能体(Agent)在GPU服务器上的部署、配置与上线工作
2、负责AI网关组件运维工作,云原生k8s组件部署、AI网关限流、鉴权等相关中间件监控、配置和问题排查。推动AI网关产品功能优化
3、负责AI网关缓存精细化运营,建立完善网关缓存可观测体系,增强成本优化、性能提升和系统稳定性
4、负责开发运维脚本或工具,为自动化运维(配置管理、监控、部署、调度等)提供工具或系统支持,来提高运维部署的效率;
5、参与技术方案和系统设计方案评审,掌握相关的技术架构和原理,能够从运维角度主动识别方案风险,并给出专业的解决方案。
6、根据日常反馈以及业务发展需要,不断推动系统/流程迭代升级,快速响应业务需求;
7、负责资源供应商管理,资源冗余评估,调度等相关工作。
任职条件
1、大学本科及以上学历,并取得相应学位,计算机类专业优先;
2、八年及以上运维研发工作经验,其中三年及以上运维相关经验;
3、熟悉Python/Shell中的任意一种以上技术语言,熟悉常见的配置管理和运维工具,如Ansible、Puppet、SaltStack、Fabric等;
4、熟悉HTTP缓存和代理服务器(如nginx、TrafficServer等)配置和使用,具备较强的troubleshooting能力;
5、熟悉云计算平台OpenStack、Kubernetes及docker/kvm/xen等虚拟化技术优先,有管理大规模服务器集群经验优先;
6、有开源大模型维护经验者优先,有大规模GPU算力集群(千卡级)调度与调优经验优先
7、有AI网关运维和AI网关缓存精细化运营经验优先
8、诚实守信、作风踏实严谨、责任心强,具备良好团队协作能力精神,学习能力强,善于解决复杂问题;