锦鲤求职

知乎

AI Infra 工程师(27届)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责

根据个人经验和团队方向,参与以下一个或多个方向:

- 建设大模型预训练、微调及强化学习基础设施,支持多机多卡任务编排、资源调度、断点恢复和故障容错。

- 优化分布式训练性能,分析计算、通信、显存、数据读取和负载不均衡等瓶颈,提升 GPU 利用率与训练吞吐。

- 参与大模型推理服务和推理引擎研发,优化批处理、KV Cache、并行策略、模型加载、请求调度及显存管理。

- 建设 GPU 集群的任务调度、监控告警和可观测性能力,定位训练或推理过程中跨框架、网络、存储及硬件的复杂问题。

- 将重复的排障和交付过程沉淀为工具、自动化流程与工程规范,提升算法团队的实验和迭代效率。

- 跟进分布式训练、推理系统、AI 编译器和高性能计算方向的前沿工作,完成工程验证并推动落地。

任职要求

- 计算机、软件工程、人工智能、电子工程或相关专业,本科及以上学历。

- 具备扎实的计算机基础,理解操作系统、计算机网络、数据结构、并发编程中的基本概念。

- 熟悉 Linux 开发环境,熟练使用 Python,并掌握 C++、Go、Rust 中至少一种语言。

- 使用过 PyTorch、JAX、PaddlePaddle 等至少一种深度学习框架,对大模型训练或推理流程有基本理解。

- 具备良好的工程能力,能够编写可维护的代码,并通过日志、监控、Profiler 和最小化实验定位问题。

- 对性能数据敏感,能够使用吞吐、延迟、显存、资源利用率、任务成功率等指标验证优化效果。

- 具备良好的学习能力、责任心和协作意识,愿意处理跨模型、框架与基础设施边界的复杂问题。

实践经验(满足以下任意一个方向即可,不要求全部具备):

- 实现或优化过分布式训练、模型并行、数据并行或强化学习训练流程。

- 使用过 Megatron-LM、DeepSpeed、FSDP、Ray、verl 等训练或调度框架。

- 使用过 vLLM、SGLang、TensorRT-LLM 等推理框架,并做过吞吐、延迟或显存分析。

- 有 CUDA、Triton、算子融合、量化或其他 GPU 性能优化经验。

- 排查过 NCCL、RDMA、网络、存储或多机多卡训练问题。

- 使用 Kubernetes、Slurm 等系统管理过 GPU 任务,或建设过监控、容错与自动恢复能力。

- 有相关开源贡献、技术项目、竞赛成果或系统/机器学习方向的科研经历。

加分项

- 理解张量并行、流水线并行、数据并行、序列并行或专家并行等技术。

- 熟悉连续批处理、Paged Attention、KV Cache、量化、投机解码或计算通信重叠。

- 使用过 Nsight Systems、PyTorch Profiler、Prometheus、Grafana 等性能分析或可观测性工具。

- 对 GPU 架构、NCCL Collective、RDMA、GPUDirect 或高性能存储有实践经验。

- 在 PyTorch、vLLM、SGLang、Megatron-LM、DeepSpeed、verl 等项目中有贡献。

- 有 MLSys、OSDI、SOSP、NSDI、EuroSys、NeurIPS、ICML 等相关论文或高质量技术成果。

后端开发方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →