锦鲤求职

北电数智

智算平台架构师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
职级:5/6级
岗位使命
面向多芯片异构算力(GPU/NPU/CPU),建设统一的云原生智算云平台:实现大规模集群的 高可用、可观测、低成本与高性能 运维;以分层解耦的方法论快速定位问题,支撑模型训练、推理与行业应用的持续交付。
核心职责
1、云原生与多云架构
1)基于 Kubernetes 规划多集群/跨可用区/多 IDC 架构,支持混合云与边缘协同;设计高可用与容灾(多活/双活)。
2)负责容器化、应用与服务治理:Helm/Kustomize、Ingress/Gateway(Kong/APISIX)、API 生命周期管理。
2、异构算力编排与调度
1)设计 CPU/GPU/NPU 混合调度与 QoS 策略,Gang Scheduling(Volcano)、拓扑/NUMA 感知、弹性与容量管理(HPA/VPA/KEDA)。
2)结合 Spot/抢占/回收 与计量计费联动,形成成本最优策略;支持 MIG/vGPU/MPS 等 GPU 共享能力。
3、高性能网络与存储
1)规划并优化 RoCEv2/IB、CNI(Cilium/Calico);治理跨 NUMA、跨机架链路瓶颈。
2)设计高吞吐数据面:对象/并行存储(Ceph/Rook/S3/MinIO/Longhorn);推动高性能芯片服务器与对象存储在 RoCE 网络上的高效对接。
4、训练/推理平台与性能优化
1)建设训练/推理工作流:Kubeflow、Ray、Argo Workflows;模型服务(Triton/KServe),多租户限流与配额隔离。
2)端到端性能基线与压测体系(NCCL-tests、fio/iperf/uperf/MLPerf);参与优化并行策略(TP/PP/MoE)、KV-Cache、批处理与低时延推理。
5、可观测性与稳定性工程

1)建设统一观测:Prometheus/Thanos + Grafana + ELK,OpenTelemetry Tracing;SLO/SLA、容量与能耗视图。
2)GPU软硬件故障感知(掉卡、ECC error、系统参数/组件配置错误等)与告警闭环;推进 AIOps 与 分层解耦诊断 方法论与工具链落地。
6、DevSecOps / GitOps 与供应链安全
1)持续交付与回滚:ArgoCD/Flux、Tekton/GitLab CI;IaC(Terraform)实现平台可复制交付。
2)SBOM、镜像签名、制品仓与加速、合规扫描;落地审计与访问控制(OIDC/OAuth2、OPA/Gatekeeper)。
7、平台产品化与对外交付
1)统一 Portal/API/SDK、计量计费、配额与自助服务;与模型/数据/业务团队协同,推动需求到上线的端到端闭环。
2)输出架构蓝图、SOP、RCA 报告与最佳实践,沉淀标准件与可复用能力。

岗位要求
任职资格(必须)
1、5–8 年以上云原生/分布式系统经验,3 年以上 AI 训练或推理平台实践。
2、精通 Kubernetes 内核机制(Scheduler、Controller、CRI/CNI/CSI),具备 Operator/CRD 设计与开发经验。
3、熟悉 Helm/Kustomize、Service Mesh、Ingress/Gateway、CI/CD 与 GitOps(ArgoCD/Flux),具备大规模变更治理能力。
4、具备 GPU/NPU 资源管理与调优经验:Volcano/Kubeflow/Ray、Triton/KServe、MIG/vGPU、NCCL/RDMA。
5、掌握 RoCE/IB、Ceph/Rook、对象存储与数据面优化。
6、可观测与稳定性:Prometheus/Thanos、ELK、OpenTelemetry;能建立性能基线、容量规划与 SLO 体系。
7、编程能力扎实:Go/Python/Rust 其一;能定位内核/容器/网络路径问题并给出工程修复。
8、沟通与文档能力强,能推动跨团队对齐并产出规范与复盘材料。

加分项
1、公有云 EKS/AKS/ACK/GKE 等落地经验,多云/裸金属自动化(Metal3/MAAS/PXE)。
2、推理网关与多租户计费/限流/审计实践
3、MLPerf/Ray 大规模作业调度优化、MoE 训练/推理优化经验。
4、AIOps、异常检测/根因定位相关开源贡献或专利。
5、熟悉等保/信创体系与行业级合规要求。

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →