岗位描述
岗位职责:
参与分布式推理系统建设,提供行业领先的LLM/多模态模型解决方案;
针对大语言模型(LLM)等场景,开展端到端推理性能优化,重点降低推理延迟、提升吞吐量;
针对大语言模型(LLM)等场景,开展端到端推理精度分析,提升模型精度;
开发和维护大语言模型(LLM)量化工具等。
任职要求:
本科及以上学历,计算机、电子工程、自动化、数学等相关专业优先;
精通Python/C++;
深入理解LLM或者视觉生成模型框架和原理;
深入理解量化、kvcache、多机多卡并行等加速技术。
加分项:
有GPU/加速卡调优实践经验;
有开源仓库的贡献经验;
参与过LLM或者视觉生成端到端推理优化项目,并实际落地;
有集群部署经验。
注:本岗位设置笔试环节,请留意邮件或短信通知。