岗位描述
岗位简介
加入我们,你将负责自动驾驶大模型从实验室到车端落地的关键一环——构建高吞吐、低延迟的推理服务平台。你会接触到业界最前沿的推理引擎(TensorRT、SGLang、vLLM)、KV Cache 共享与 P/D 分离架构,以及面向多模态大模型(VLM)的异构推理优化,直接影响自动驾驶系统的实时感知与决策能力。
岗位职责
推理服务化平台建设:参与构建高可用的模型推理服务平台,支持 LLM / VLM 等模型的服务化部署、弹性扩缩容与多租户隔离。
推理引擎深度优化:基于 TensorRT、TorchScript、SGLang、vLLM 等框架进行推理性能优化,探索 INT8/FP8 量化、算子融合、动态 Batch 等加速手段。
KV Cache 与显存管理:参与设计高效的 KV Cache 管理策略(如 Mooncake / LMCache 方案),支持长上下文场景下的显存高效利用与跨实例共享。
P/D 分离与推理架构:参与 Prefill-Decode 分离架构的设计与实现,优化首 token 延迟与整体吞吐,支撑自动驾驶场景下的实时交互需求。
端云协同推理:探索车端(Thor / Orin 等)与云端协同推理方案,参与模型轻量化、蒸馏与边缘部署优化。
任职要求
2027届本科及以上学历,计算机科学、软件工程、人工智能等相关专业。
扎实的编程功底,熟练掌握 Python / C++,了解 Go / Rust 者优先。
熟悉至少一种深度学习框架(PyTorch / TensorFlow),了解模型推理部署的基本流程。
对计算机体系结构有基本理解,了解 GPU 加速计算原理(CUDA 编程基础)。
具备良好的系统思维、性能敏感度和工程交付能力。
加分项
有模型推理优化经验(量化、剪枝、蒸馏、算子优化),熟悉 TensorRT / ONNX Runtime / vLLM 等推理引擎。
了解大模型推理架构(PagedAttention、Continuous Batching、Speculative Decoding)。
熟悉 Kubernetes 及云原生技术,有容器化服务部署经验。
有 ACM/ICPC、NOI 等竞赛经历,或参与过开源 AI 系统项目(如 vLLM、SGLang、Triton Inference Server)。