锦鲤求职

地平线机器人

【2027届校招】模型推理优化工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

工作内容
"你将参与的事
我们正在构建下一代大模型推理与智能体平台(LLM Inference & Agent Platform),面向 AI Coding、研发效能提升与企业级智能体(Agent)等核心场景,提供从底层基础设施到上层应用的全栈推理能力。
作为模型推理优化工程师,你将在大规模异构 GPU 集群上,围绕推理引擎、调度系统与智能体运行时三层,持续优化推理系统的吞吐(Throughput)、首 Token 延迟(TTFT)、GPU 利用率以及单位 Token 推理成本($/M Tokens),同时为上层 Agent 应用构建高效、可靠的基础底座。你将参与以下方向:
推理基础设施优化:参与自研大模型推理平台的系统研发与架构演进,覆盖从 GPU 算子到服务层的完整链路;深入 CUDA / Triton / CUTLASS 等底层算子优化,提升 Prefill 与 Decode 阶段的计算效率
推理框架与系统研发:设计和实现高效推理架构,包括 Prefill / Decode 分离式推理(Disaggregated Serving)、Continuous / Dynamic Batching 与请求级调度策略、异构推理资源调度(跨 GPU 型号、跨集群的智能分配)、分布式 KV Cache 管理(多级缓存、跨节点共享与前缀复用);基于 SGlang、vLLM、TensorRT-LLM 等开源框架进行深度定制与二次开发
智能体(Agent)运行时优化:参与智能体运行时的设计与开发,优化多轮对话、工具调用(Tool Use / Function Calling)场景下的推理延迟与吞吐;设计高效的 Agent 调度与并发执行框架,支持多 Agent 协作与长链路任务编排;构建 Agent 可观测性体系——推理链路追踪、性能瓶颈分析与成本归因

我们需要的人
基本要求
1.2027 届本科及以上学历,计算机科学、人工智能、电子工程或相关专业
2.扎实的计算机基础:深入理解操作系统原理、计算机体系结构、数据结构与算法,对系统性能优化有直觉
3.在以下至少一个领域具备扎实基础:
①GPU / 高性能计算:CUDA 编程、算子优化、内存管理
②分布式系统:一致性、调度、通信原理
③大模型推理或训练系统:Serving 架构、并行策略、显存优化
4.优秀的编程能力:熟练使用 Python / C++ / CUDA / Go / Rust 中至少一门语言,具备良好的工程素养与代码风格
5.强烈的好奇心与自驱力:对 AI Infra / MLSys / LLM Serving / Agent System 方向充满热情,愿意深入底层解决系统级问题
6.良好的沟通协作能力:能清晰表达技术方案,与团队成员高效协同
加分项
1.推理框架经验:熟悉 SGlang、vLLM、TensorRT-LLM、DeepSpeed-Inference 等主流推理框架,有源码阅读或深度贡献(PR / Issue)经历
2.系统开发实习:在头部科技公司的 AI Infra、推理引擎、高性能计算或云原生团队有实习经验
3.Agent / RAG 系统经验:有 Agent、RAG、Multi-Agent 系统或 Function Calling 相关的开发与项目经验
4.云原生基础设施:熟悉 Kubernetes,了解 GPU 调度与容器编排
5.竞赛或科研经历:ACM/ICPC 等算法竞赛获奖,或在 MLSys / 系统 / AI 顶会(OSDI、SOSP、MLSys、NeurIPS、ICML、NSDI 等)有相关研究成果
6.开源影响力:有开源项目贡献或技术博客 / GitHub 活跃记录

为什么选择我们
站在 AI 系统的最前沿:你将直接参与大模型推理引擎和智能体平台的从 0 到 1 建设,接触 Disaggregated Serving、分布式 KV Cache、异构调度等行业最前沿的系统工程问题
真实的工程影响力:代码直接运行在大规模异构 GPU 生产集群上,你的每一次优化都在降低推理成本、加速整个公司的 AI 产品交付
全栈成长路径:从 GPU 算子到推理引擎到 Agent 运行时,你将获得横跨底层系统与上层应用的完整技术视野;完善的技术导师制度帮助你快速成长为 AI Infra 领域的核心人才
开放的技术文化:鼓励技术创新和开源贡献,支持参与顶级系统领域学术会议和社区;团队保持高频技术分享,技术氛围浓厚"

任职条件
我们需要的人
基本要求
1.2027 届本科及以上学历,计算机科学、人工智能、电子工程或相关专业
2.扎实的计算机基础:深入理解操作系统原理、计算机体系结构、数据结构与算法,对系统性能优化有直觉
3.在以下至少一个领域具备扎实基础:
①GPU / 高性能计算:CUDA 编程、算子优化、内存管理
②分布式系统:一致性、调度、通信原理
③大模型推理或训练系统:Serving 架构、并行策略、显存优化
4.优秀的编程能力:熟练使用 Python / C++ / CUDA / Go / Rust 中至少一门语言,具备良好的工程素养与代码风格
5.强烈的好奇心与自驱力:对 AI Infra / MLSys / LLM Serving / Agent System 方向充满热情,愿意深入底层解决系统级问题
6.良好的沟通协作能力:能清晰表达技术方案,与团队成员高效协同
加分项
1.推理框架经验:熟悉 SGlang、vLLM、TensorRT-LLM、DeepSpeed-Inference 等主流推理框架,有源码阅读或深度贡献(PR / Issue)经历
2.系统开发实习:在头部科技公司的 AI Infra、推理引擎、高性能计算或云原生团队有实习经验
3.Agent / RAG 系统经验:有 Agent、RAG、Multi-Agent 系统或 Function Calling 相关的开发与项目经验
4.云原生基础设施:熟悉 Kubernetes,了解 GPU 调度与容器编排
5.竞赛或科研经历:ACM/ICPC 等算法竞赛获奖,或在 MLSys / 系统 / AI 顶会(OSDI、SOSP、MLSys、NeurIPS、ICML、NSDI 等)有相关研究成果
6.开源影响力:有开源项目贡献或技术博客 / GitHub 活跃记录

为什么选择我们
站在 AI 系统的最前沿:你将直接参与大模型推理引擎和智能体平台的从 0 到 1 建设,接触 Disaggregated Serving、分布式 KV Cache、异构调度等行业最前沿的系统工程问题
真实的工程影响力:代码直接运行在大规模异构 GPU 生产集群上,你的每一次优化都在降低推理成本、加速整个公司的 AI 产品交付
全栈成长路径:从 GPU 算子到推理引擎到 Agent 运行时,你将获得横跨底层系统与上层应用的完整技术视野;完善的技术导师制度帮助你快速成长为 AI Infra 领域的核心人才
开放的技术文化:鼓励技术创新和开源贡献,支持参与顶级系统领域学术会议和社区;团队保持高频技术分享,技术氛围浓厚

后端开发方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →