锦鲤求职

千里科技

AI infra工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

职位描述:

我们正在建设面向自动驾驶大型模型训练的 AI 基础设施平台,支持多云异构 GPU 集群、训练任务调度、数据与算力协同,以及大规模 AI Workflow 的稳定运行。你将参与 AI 训练平台与生产系统的设计、建设与持续优化,提升整体资源效率、系统稳定性与研发体验。

工作内容:

AI 训练基础设施建设与运维

参与 GPU 集群、Kubernetes 平台的建设与稳定性优化

支持大规模训练任务的运行与问题排查

参与训练链路的资源调度、任务治理与容量管理

优化训练平台的可用性、可观测性与自动化能力

平台稳定性与效率优化

参与训练任务异常恢复、告警、监控体系建设

协助定位训练性能问题(网络 / 存储 / GPU / 调度等)

持续提升 GPU 利用率与资源交付效率

推动平台工程化与标准化建设

AI Workflow 与云平台协同

支持 Argo Workflow / GitLab CI 等平台能力建设

参与多云资源管理与异构算力接入

协助建设统一 AI 生产系统与研发工作流

任职要求:

基础要求:

熟悉 Linux、网络与容器基础设施

熟悉 Kubernetes 生态与常见运维工具

具备一定自动化运维或平台开发能力(Python / Go 等)

具备较强的问题定位与工程推进能力

加分项:

以下经验任意方向有了解即可:

GPU / AI 训练平台相关经验

Kubernetes GPU 调度经验

RDMA / 高性能网络经验

Argo Workflow / Ray / Slurm 使用经验

大模型或自动驾驶训练平台经验

存储系统(Alluxio / Ceph / Lustre / GPFS 等)经验

多云平台或混合云经验

运维/技术支持方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →