岗位描述
岗位职责:
参与分布式推理系统建设,提供行业领先的LLM/多模态模型解决方案;
针对大语言模型(LLM)、视觉生成(如Diffusion Models)等场景,开展端到端推理性能优化,重点降低推理延迟、提升吞吐量;
深度优化推理框架,提升框架在异构硬件上的扩展性与易用性;
开发自动化性能分析工具,实现推理瓶颈的快速定位与优化建议生成。
任职要求:
计算机、电子工程、自动化、数学、物理等相关专业优先;
有PyTorch/C++/Python编程经验;
有AI模型的训练/部署经验;
了解LLM或者视觉生成模型原理;
了解量化、kvcache、多机多卡并行等加速技术。
加分项:
1具备CUDA/BANGC等异构编程经验,有GPU/加速卡调优实践经验;
有开源仓库的贡献经验;
了解torch.compile/CUDAGraph/Triton;
具备以下任意领域的实战经验;
大模型推理框架:vLLM/SGLang/FasterTransformer/TensorRT-LLM;
视觉生成系统:Diffusers/ComfyUI/xDiT;
强化学习:verl等。
注:本岗位设置笔试环节,请留意邮件或短信通知。