岗位描述
岗位职责
1. 参与机器学习平台整体建设,覆盖数据生产、模型训练、推理部署全链路,支撑算法团队高效选代;
2. 参与分布式训练平台开发,包括任务提交、调度、容错与弹性训练;参与GPU集群资源管理、容器化、镜像管理、存储挂载与网络通信优化等;
3. 参与在线、离线与流式推理服务平台开发,支持高并发、低延迟模型服务;对接各种推理引擎,参与模型转换、部署与版本管理;
4. 参与数据采集、清洗、标注、质检等数据生产平台开发;参与各平台层能力建设。
岗位要求
1. 计算机、软件工程、人工智能、自动化、电子、数学等相关专业,硕士及以上学历;
2. 扎实的计算机与深度学习基础,熟悉C++和python开发;
3. 对分布式系统、云计算、MLOps、数据平台、推理优化等方向有浓厚兴趣;
4. 熟悉机器学习开发流程,熟练使用K8S/KuberFlow等基础设施,具备较好的问题解决能力;
5. 熟悉TensorFlow/PyTorch等至少一项深度学习训练或推理框架。
加分项:
1. 有机器学习平台、数据平台、训练平台或推理平台相关实习或项目经验;
2. 熟悉Spark、Flink、Ray、Dask等大数据或分布式计算框架;
3. 了解CUDA、NCCL、TensorRT、Triton、ONNX等技术;
4. 熟悉Kubernetes、云原生、微服务架构,有实际部署经验;
5. 有开源贡献、技术竞赛获奖、论文/专利或高质量技术博客;
6. 对数据生产、训练平台、推理平台全链路有整体认知。