岗位描述
岗位一:服务治理高级/架构工程师
岗位职责
1.负责公司微服务治理体系的架构设计与核心能力建设,包括服务注册发现、RPC 框架、API 网关、负载均衡等核心组件的规划与演进,支撑业务规模化发展。
2.负责流量治理能力建设:超时、重试、熔断、限流、隔离、降级等稳定性能力的标准化与平台化,以及灰度发布、全链路压测、流量调度等场景落地。
3.负责服务治理体系与 Kubernetes 原生机制的融合设计(Service、EndpointSlice、Readiness、优雅上下线等),统一容器与虚拟机场景的治理体验。
4.负责重大技术方案设计、核心系统性能优化及线上复杂问题处理,主导大规模故障治理与生产事故复盘,沉淀稳定性方法论。
5.建设服务治理标准、SDK、控制面与推广机制,推动各业务团队平滑接入与迁移,提升系统稳定性与研发效率。
任职要求
1.本科及以上学历,3 年以上 Java 开发经验,深入理解 Java、JVM、Netty、Spring Boot / Spring Cloud 技术栈,有扎实的分布式系统或基础架构建设经验,有中大型系统架构设计和演进经验。
2.实际负责过 Gateway、注册中心、RPC 框架或消息中间件中至少一个领域的核心建设,熟悉 Feign、Dubbo、gRPC 中至少两类通信栈。
3.深入理解超时、重试、熔断、隔离、限流等稳定性手段的原理与相互关系,能从业务 SLO 出发反推中间件能力设计,而非停留在选型层面。
4.有大规模故障治理和生产事故复盘经验,具备较强的系统设计、性能优化和线上问题定位能力。
5.熟悉 Kubernetes Service、EndpointSlice、Readiness、优雅下线等机制,有云原生场景服务治理经验者优先。
6.有平台产品意识,能建设标准、SDK、控制面和推广机制;具备较强的跨团队沟通与推动能力,能切实推动业务团队完成迁移落地。
7.具备良好的技术判断力,能平衡业务需求、系统复杂度和演进成本;保持技术深度和动手能力,能参与核心方案设计及关键代码评审。
加分项
1.有 Service Mesh(Istio / Envoy)开发或大规模落地经验
2.有混沌工程、全链路压测平台建设经验
3.参与过 Dubbo、Sentinel、Spring Cloud Gateway 等开源社区贡献
4.有团队管理或技术团队建设经验
岗位二:可观测性高级/架构工程师
岗位职责
1.负责公司可观测性平台(Metrics / Logging / Tracing)的架构设计与核心能力建设,为业务提供一站式监控、告警、排障与根因分析能力。
2.负责数据采集侧建设:基于 Java Agent / 字节码增强的无侵入探针、OpenTelemetry 标准接入、多语言 SDK 体系,持续降低业务接入成本。
3.负责遥测数据存储与计算架构演进:海量指标、日志、链路的写入、索引与查询优化,平衡查询体验与资源成本。
4.负责告警体系与故障定位能力建设,将可观测能力与故障治理流程(发现—定位—止损—复盘)深度结合,缩短 MTTR。
5.制定可观测性接入标准与最佳实践,推动各业务团队规模化接入,建设平台化、自助化的可观测产品。
任职要求
1.本科及以上学历,3 年以上开发经验,深入理解 Java / JVM,熟悉多线程与字节码增强(ASM / ByteBuddy)、Java Agent 原理;或具备 Go / C++ 高性能组件开发经验。
2.熟悉 Prometheus、Grafana、ELK / Loki、SkyWalking、OpenTelemetry 等可观测性生态中多个组件的原理与源码,有 APM、监控平台或链路追踪系统的实际建设经验。
3.理解指标、日志、链路三者的数据模型与关联方式,能从故障定位、根因分析等真实场景反推数据模型与产品能力设计,而不是只会搭建开源组件。
4.具备海量数据处理经验,了解时序数据库、列式存储、流式计算,以及采样、降精度等遥测数据成本治理手段。
5.具备较强的系统设计、性能优化和线上问题定位能力,能主导重大技术方案设计并处理线上复杂问题。
6.有平台产品意识和成本意识,具备较强的跨团队沟通与推动能力,能推动可观测能力在业务团队规模化落地。
7.具备良好的技术判断力,能平衡业务需求、系统复杂度和演进成本;保持技术深度和动手能力,能参与核心方案设计及关键代码评审。
加分项
1.熟悉 eBPF、Continuous Profiling(持续剖析)、RUM 等前沿可观测技术
2.熟悉 OpenTelemetry 规范,有相关社区贡献
3.有大规模时序库(VictoriaMetrics / Thanos / M3DB 等)或异构存储优化经验
4.有 SRE 体系建设或 SLO 落地经验