岗位描述
负责 RoboX 云端平台控制面、监控系统、可观测性底座和工程交付体系建设,支撑⻋辆、舱端、会话、权限、审计、调度、链路质量观测、异常定位、高并发稳定性保障和云端服务标准化发版。
主要职责:
1、负责平台服务接口、用户/⻋辆/舱端管理、会话管理、权限审计、接管互斥和控制审计等核心后端能力。
2、建设全链路可观测性体系,包括指标采集 SDK、数据网关、实时计算、时序数据存储、告警规则和监控看板。
3、面向⻋云链路、实时音视频、控制通道和状态回传等关键链路,建设链路质量指标、异常事件、会话日志和回放索引。
4、负责高并发场景下的服务稳定性治理,包括容量评估、性能调优、限流降级、灰度发布、故障演练和 Oncall 机制。
5、负责云端服务 CI/CD 与发布流程建设,熟悉基于 Kubernetes / Helm 的主流发版、灰度、回滚、配置管理和多环境交付流程。
6、参与云资源与基础设施治理,包括云迁移、Kubernetes 集群服务治理、Helm Chart 维护、对象存储治理、日志存储成本优化和数据生命周期管理。
任职要求:
1、熟悉 Go / Java / Python 任一后端技术栈,具备微服务、分布式系统或监控平台研发经验。
2、熟悉 MySQL / PostgreSQL / Redis / Kafka / Pulsar / Elasticsearch 等常⻅中间件。
3、熟悉指标、日志、链路追踪、告警、监控看板等可观测性体系,理解 OpenTelemetry / Prometheus / Metrics SDK 等技术思路。
4、熟悉实时数据处理或时序数据存储,具备 Flink、InfluxDB、Prometheus TSDB、ClickHouse 等相关经验者优先。
5、熟悉 Kubernetes、Helm、CI/CD 流水线、镜像构建、配置管理、灰度发布和回滚流程,能够独立推动云端服务的标准化交付。6、具备高并发系统调优、线上故障定位、稳定性保障和跨团队推动能力。
加分项:
有百万级并发、核心监控系统、公司级基础组件、数据网关或指标 SDK 建设经验。有生产环境 Oncall、SRE、容量治理、故障演练或稳定性平台建设经验。有 Helm Chart 治理、GitOps、Argo CD、Jenkins、GitLab CI 或多环境发布体系建设经验。有云迁移、对象存储治理、日志成本优化或多云/混合云基础设施治理经验。