锦鲤求职

智谱AI

MaaS-高级平台工程师(研发效能与稳定性方向)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责

1、负责研发效能平台的规划、设计与建设,覆盖需求、开发、构建、测试、发布及运营等研发全生命周期,持续提升研发交付效率和质量。

2、建设和优化 CI/CD、质量门禁、自动化测试、环境管理、发布编排及研发度量等平台能力,推动研发流程标准化、自动化和数据化。

3、建立研发效能指标体系,分析研发过程中的等待、返工、失败和瓶颈,推动构建耗时、交付周期、发布频率、变更失败率等关键指标持续改善。

4、负责性能测试与容量治理体系建设,包括压测平台、流量模型、容量评估、全链路压测、性能基线及容量水位管理。

5、针对高并发和复杂业务场景开展性能分析,定位应用、数据库、缓存、消息队列、网络及基础设施等环节的性能瓶颈,并推动优化落地。

6、建设稳定性红队能力,从对抗视角主动发现系统在架构、依赖、容量、配置、数据和应急机制等方面的薄弱环节。

7、规划并实施稳定性红队演练、突袭演练和极端场景验证,检验系统及团队在真实故障条件下的发现、定位、处置和恢复能力。

8、建设故障注入与混沌工程平台,设计进程异常、网络延迟、依赖超时、资源耗尽、节点宕机、缓存失效、消息积压等故障场景。

9、建立故障演练的安全控制机制,包括爆炸半径控制、自动熔断、健康检查、快速回滚和演练审计,保障演练过程安全可控。

10、推动可观测性、容灾、降级、限流、熔断、故障自愈和应急响应体系建设,提升系统可用性及故障恢复能力。

11、参与重大故障复盘,推动问题从个案修复升级为平台能力、工程规范和自动化防线,减少同类故障重复发生。

12、与研发、测试、运维及架构团队协作,推广平台工程、SRE、混沌工程和研发效能实践。

任职要求

1、本科及以上学历,计算机、软件工程或相关专业,5 年及以上研发、平台工程、SRE、DevOps或稳定性工程经验。

2、具备扎实的软件工程能力,熟练掌握 Java、Go、Python 等至少一种主流编程语言,能够独立完成平台及工程工具的设计与开发。

3、熟悉 Git、CI/CD、自动化测试、制品管理、发布编排及质量门禁,有研发效能平台或内部开发者平台建设经验。

4、熟悉 Linux、容器和 Kubernetes,了解微服务、服务治理、云原生基础设施及分布式系统常见故障模式。

5、具备实际性能测试经验,熟悉 JMeter、Gatling、Locust、k6 等一种或多种工具,能够设计符合真实业务特征的压测模型。

6、能够基于吞吐量、并发数、响应时间、错误率、资源利用率等指标开展容量评估和性能瓶颈分析。

7、具备全链路压测、流量染色、数据隔离、影子库、压测流量清理或类似方案的实践经验。

8、具备稳定性红队或混沌工程实践经验,能够从系统薄弱点出发设计具有对抗性的故障场景,而非仅执行预设演练脚本。

9、具备真实故障注入经验,熟悉 Chaos Mesh、LitmusChaos、Gremlin、ChaosBlade 等工具之一,或有自研故障注入平台经验。

10、熟悉日志、指标、链路追踪和告警体系,能够使用 Prometheus、Grafana、ELK、Loki、SkyWalking、Jaeger 等工具进行故障分析。

11、理解高可用、容灾、限流、熔断、降级、隔离、重试、幂等及故障自愈等稳定性设计原则。

12、具备良好的系统性思考、跨团队沟通和项目推动能力,能够将复杂工程问题沉淀为平台产品、标准规范及可度量机制。

加分项

1、主导过中大型研发效能平台、内部开发者平台或一站式工程平台建设。

具备大型互联网业务、金融核心系统或高并发分布式系统的全链路压测经验。

2、组织过跨系统、跨团队的稳定性红队演练或重大容灾演练。

3、具备生产环境故障注入经验,并建立过完善的准入、熔断、回滚和审计机制。

4、具备多活、异地容灾、单元化、流量调度或大规模 Kubernetes 集群稳定性治理经验。

5、熟悉 DORA、SPACE、DevEx 等研发效能度量框架,并有实际改善案例。

6、具备开源项目贡献、技术社区分享或相关平台产品化经验。

7、对 AI 辅助研发、智能测试、智能故障定位或智能运维有实践经验。

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →