岗位描述
职位描述
1. 负责自研机器学习平台训练&推理相关工具链的运维和二次开发工作;
2. 负责GPU集群的运维工作,关注模型训练、推理过程中的稳定性、资源利用率等问题;
岗位要求
1. 熟悉k8s,具有线上k8s集群运维经验;
2. 具有Golang/Python/C++等至少一种高级语言开发经验;
3. 具有Alluxio/Juicefs等分布式存储系统工作经验者优先;
4. 熟悉Kubeflow/Airflow等MLOps、流程编排系统者优先;
5. 熟悉GPU架构,具有机器学习平台、模型训练、模型推理工作经验者优先;