锦鲤求职

地平线机器人

【地瓜机器人】AI训练平台交付项目经理兼测试

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

工作内容
1. 负责混合云及AI训练平台的项目交付工作
参与客户侧平台部署、环境初始化、资源配置、功能验证、上线支持等工作,保障项目按计划完成交付。
2. 负责客户日常技术支持与问题解答
对接客户在使用平台过程中的各类问题,包括账号权限、资源申请、任务提交、训练环境、镜像使用、数据挂载、作业调度、日志排查等。
3. 协助客户完成计算资源配置与使用指导
根据客户业务需求,协助配置 CPU、GPU、存储、网络、镜像、队列、命名空间等平台资源,指导客户合理使用混合云资源。
4. 解答算法训练相关问题
支持客户在模型训练过程中的常见问题排查,包括训练任务失败、依赖环境异常、显存不足、分布式训练配置、数据读取异常、性能瓶颈、训练日志分析等。
5. 负责平台功能测试与交付验证
根据项目需求和产品版本,编写或执行测试用例,完成平台功能测试、接口测试、部署验证、回归测试、兼容性测试等工作,输出测试结果和问题反馈。
6. 跟踪并推动问题闭环
对客户反馈的问题进行记录、复现、分析和定位,协调研发、产品、运维等团队推动问题解决,并及时向客户同步处理进展。
7. 沉淀交付与支持文档
编写并维护部署文档、操作手册、FAQ、客户培训材料、测试报告、交付报告等,提高交付效率和客户满意度。
8. 参与客户培训和平台使用指导
面向客户管理员、算法工程师或业务团队进行平台功能讲解、操作培训和最佳实践分享。

任职条件
1. 本科及以上学历,计算机、软件工程、人工智能、通信、自动化等相关专业优先。
2. 具备 2年以上技术支持、项目交付、测试工程师、运维工程师或AI平台相关工作经验,有企业客户交付经验优先。
3. 熟悉 Linux 基础操作,能够进行常见命令操作、日志查看、进程排查、网络连通性检查、磁盘与资源使用分析。
4. 熟悉云平台或容器化相关技术,了解 Kubernetes、Docker、镜像、Pod、Namespace、GPU资源调度等概念者优先。
5. 了解AI模型训练基本流程,熟悉 PyTorch、TensorFlow、Jupyter、Notebook、训练脚本、依赖环境、数据集、模型输出等常见使用场景。
6. 具备一定的问题排查能力,能够根据报错日志、平台状态、资源使用情况定位常见问题,并推动问题解决。
7. 具备测试工程师基础能力,能够编写测试用例、执行测试、提交缺陷、跟踪缺陷修复,并输出测试报告。
8. 具备良好的客户沟通能力和服务意识,能够清晰理解客户需求,并用专业、耐心的方式解决客户问题。
9. 具备较强的文档编写能力,能够沉淀交付方案、操作手册、FAQ、测试报告等文档。
10. 工作认真负责,具备较强的执行力、学习能力和跨团队协作能力,能适应一定程度的客户现场或远程交付工作。

加分项
1. 有混合云、私有云、公有云、AI算力平台、GPU集群、MLOps平台交付经验者优先。
2. 熟悉 Kubernetes、Volcano、KubeFlow、Ray、Slurm、Harbor、Prometheus、Grafana 等技术或组件者优先。
3. 有算法训练平台、机器学习平台、数据科学平台、Notebook平台、模型开发平台使用或交付经验者优先。
4. 熟悉分布式训练、多卡训练、GPU显存优化、训练性能调优等相关问题者优先。
5. 有ToB客户支持经验,能够独立完成客户沟通、问题定位、方案输出和项目交付者优先。
6. 有自动化测试、接口测试、性能测试、Python脚本编写经验者优先。

---
岗位关键词
混合云、AI训练平台、项目交付、技术支持、客户支持、GPU资源、Kubernetes、Docker、模型训练、算法训练、平台测试、测试用例、问题排查、ToB交付。

---
简洁版岗位描述
我们是一家专注于混合云和AI训练平台的厂商,现招聘一名交付工程师,主要负责AI训练平台在客户侧的部署交付、资源配置、日常技术支持和问题排查工作。你将直接对接客户,解答客户在平台使用、算法训练、GPU资源、训练环境、任务调度等方面的问题,同时参与平台功能测试、回归测试和交付验证,推动客户问题闭环并沉淀相关文档。
这个岗位适合具备技术支持、项目交付、测试工程师或AI平台运维经验的人选,需要有较强的客户沟通能力、问题排查能力和学习能力。

项目管理方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →