锦鲤求职

文远知行

训练集群调度器研发工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位概述

负责公司自动驾驶端到端大模型训练平台的核心调度系统设计与开发。面向千卡/万卡级 GPU 集群,打造高吞吐、高资源利用率、网络拓扑感知的训练任务调度引擎,支撑大规模分布式训练(PyTorch/NCCL)的高效稳定运行。

核心职责

1、调度系统架构与开发

设计并实现面向 AI 训练场景的集群调度器,支持 Kubernetes / Slurm / 自研调度框架的二次开发与深度优化

实现 Gang Scheduling、Capacity Scheduling、抢占与弹性扩缩容等核心调度策略

开发任务排队、优先级管理、资源配额与多租户隔离机制

2、GPU 与网络拓扑感知调度

构建 GPU 亲和性调度(NVLink / PCIe 拓扑感知),最小化跨节点通信开销

实现 RDMA/RoCE 网络拓扑感知的节点分配与流量调度,避免拥塞热点

支持 GPU 虚拟化(MIG / vGPU / 时间片共享)场景下的精细化资源调度

3、训练效率与集群利用率优化

分析训练任务特征(通信模式、内存占用、I/O 模式),优化资源分配策略

开发自动化的训练任务画像与资源推荐系统,减少资源碎片与分配不均

设计故障感知调度与快速重试机制,降低大规模训练中的单点故障影响面

4、调度系统可观测性与稳定性

构建调度全链路监控(调度延迟、队列等待、资源碎片率、任务失败归因)

开发调度器性能压测框架与混沌工程工具,保障万卡规模下的调度稳定性

任职要求

学历:计算机科学、软件工程或相关专业本科及以上学历

经验:1 年以上分布式系统 / 云原生 / 集群调度相关开发经验;有大规模 GPU 集群(1000+ 卡)调度经验者优先

技术基础:

精通 Kubernetes 调度框架(Scheduler Framework / Scheduler Extender / Volcano / Yunikorn 等),熟悉其源码与插件机制

熟悉 Linux 内核 CGroup / Namespace 机制,具备容器运行时(Containerd / Docker)深度使用经验

扎实的分布式系统理论基础,熟悉一致性协议、资源调度算法(如 Bin-Packing、Spread、拓扑排序)

领域知识:

理解 AI 训练工作负载特征,熟悉 PyTorch Distributed / NCCL 通信原语

了解 GPU 服务器硬件架构(NVLink / PCIe Switch / RDMA NIC),具备网络拓扑感知调度的实践经验

熟悉 CUDA 编程模型或具备 GPU 性能分析(Nsight / Ncu)经验者优先

加分项

有 Volcano / Yunikorn / Slurm / Ray 等开源调度系统的贡献或深度定制经验

熟悉 eBPF 技术,具备基于 eBPF 的网络流量监控或调度辅助决策经验

有自动驾驶 / 大模型训练平台 / 超算中心调度系统建设经验

熟悉 Go / Rust 语言,具备高性能调度系统开发经验

我们提供

参与头部自动驾驶公司核心训练平台建设,直面千卡级 GPU 集群调度挑战

与 AI 框架、编译器、高性能网络团队深度协同,端到端优化训练效率

技术导向的团队氛围,鼓励开源贡献与技术沉淀

后端开发方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →