岗位描述
工作职责
1、算子开发与性能调优
参与大模型算子加速库的研发,针对GPU/AI芯片等异构硬件平台进行高性能计算优化;
分析系统性能瓶颈(如训练中断、推理延迟),通过算子优化提升离线训练/在线推理效率。
2、AI系统运维支持
协助部署维护算力集群,监控算力/显存使用率并参与调度优化;
基于Kubernetes管理AI容器,配置RDMA网络以提升分布式训练效率。
3、自动化工具开发
编写Python/Go运维脚本,实现日志管理、任务部署等流程自动化;
参与搭建AI工作流(如Kubeflow),支持数据处理→训练→部署全链路。
工作要求
1、计算机相关专业,本科,在校学生;
2、具备C++或Python编码基础,能完成代码编写与调试;
3、会基本Linux系统操作,了解Docker基础知识;
4、对大模型相关工作有浓厚兴趣,学习能力强,责任心强;
5、有良好的沟通能力,能吃苦耐劳。
专业要求
计算机及网络相关专业