锦鲤求职

蚂蚁集团

蚂蚁集团-AI SRE架构师-杭州

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位描述
1. 面向底盘业务构建连续性策略,围绕业务持续安全、可用目标,构建多端智能预警、根因定位、动线分析、资金安全保障、自愈、降级、限流、智能运维能力,协同&推动全局架构演进,为业务持续稳定运行负责;
2. 面向AI业务构建端到端对话链路稳定性体系:多模型接入与路由架构、流式服务 SLO、治理(TTFT/TPOT/超时/断流)、会话上下文与存储链路容灾、三方模型依赖的熔断/降级与治理,保障业务告诉增长过程中核心对话链路连续可用;
3. 识别业务发展过程中的效能&成本问题,重点治理 AI 推理侧成本:大小模型分流调度、推理服务弹性伸缩、GPU 容量规划与 Token 成本模型,改进工程交付效率与质量;
4. 围绕各业务大促活动,提供高性能、高可用、资金安全的常态活动保障方案,构建灵活弹性的容量调度策略,覆盖营销活动(打卡挑战、返现高峰、领奖瓜分)带动的对话洪峰与 Agent调用激增的混合流量场景,提供峰值秒杀技术能力与容量服务;
5. 同时在面向业务快速增长的过程中,能够从纷杂的业务信息中识别真实稳定性问题、抽象成可落地的架构方案(容量、弹性、成本、稳定性、资金安全等),设计并推动架构方案落地。

岗位要求
1. 知名互联网企业专注系统稳定性工作三年以上,或从事系统架构师/资深研发工程师五年以上,Java 研发功底扎实,有大规模在线服务系统架构设计和稳定性保障经验;
2. 深度参与过 AI 原生产品或大模型服务平台(如豆包、元宝、Kimi、DeepSeek、通义等)的 SRE / 稳定性 /基础架构工作两年以上,对高成本、高突发性对话流量的稳定性保障有实战方法论;
3. 具备在目标模糊、边界不清、无先例可循的业务场景中独立工作的能力:能快速从现象中定义核心问题、抽象成结构化的技术命题、设计方案并推动落地;
4. 喜欢做系统连续性、稳定性相关工作,具备较强的抗压性,愿意在技术风险 × AI Infra 交叉领域长期发展,跟随技术趋势持续探索,全力以赴拿结果。

【加分项】
有健康医疗/智能硬件领域 AI 产品稳定性经验;有“营销资金安全 + 对话 AI 混合场景”保障经验。

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →