岗位描述
工作职责
-参与设计与研发面向大模型推理服务的推理部署平台与推理引擎基础设施,构建高吞吐、低延迟、高可用的推理系统,支撑大规模Token推理请求处理
-参与大模型平台后端推理服务、推理部署平台研发
-参与平台内组件、工具的开发
- 参与定制需求的开发工作
-参与大模型推理技术调研等工作
职位要求
-计算机及相关专业本科及以上学历,熟悉常用的算法和数据结构
-精通Go/Python研发经验,具有良好的编程习惯
-熟悉Kubernetes生态,了解分离式架构、Nvidia Dynamo、LLM-D等推理系统,了解Mooncake、LMCache等KVCache基础设施,具备云原生AI平台研发经验者优先
-熟悉vLLM、SGLang、TensorRT-LLM等大模型推理引擎框架,了解多模态推理、Prefix Caching、Speculative Decoding等技术,具备工程化落地经验者优先
-具有良好的学习能力,快速接受新事物;具有良好时间意识、沟通能力、团队合作能力