岗位描述
工作内容
1. 负责大模型推理场景下KV Cache系统的整体架构设计,制定性能优化策略与技术演进路线,对全局缓存命中率与系统吞吐量负责。
2. 负责KV Cache在HBM-DRAM-SSD多级存储间的全局调度架构设计与性能建模,指导团队完成核心模块的落地与持续优化。
3. 研究并实现 Prefix Cache、Prompt Cache、Session Cache、Radix Tree 等缓存复用机制,针对长上下文、Agent 多轮对话、RAG 和高并发场景,设计差异化缓存策略。
4. 负责推理集群中KV Cache相关系统的稳定性架构设计,建立完善的可观测和评测体系体系、容灾机制,保障大规模生产环境的长期稳定运行。
5. 跟踪 KV Cache 压缩、量化、稀疏化和分层卸载等前沿技术,形成可落地的技术路线。
任职条件
1.本科及以上学历,并取得相应学位,计算机及相关专业优先
2. 8年以上系统研发经验,精通Python/C++/Go中至少一种编程语言,具备大规模分布式系统架构设计能力。
3. 具备深度Mooncake经验,主导过Mooncake系统的生产级部署与定制化改造,能够基于Mooncake进行深度的架构级二次开发。
4. 具备性能瓶颈分析与系统级调优能力,能系统性解决大规模集群场景下的延迟、吞吐与稳定性难题。
5. 能够独立完成复杂系统架构设计、性能建模和关键技术攻关,具备良好的技术判断、工程落地和跨团队协作能力。
6. LMCache、Mooncake贡献者优先。
7.诚实守信、作风踏实严谨、责任心强;具备良好团队协作能力精神;学习能力强,善于解决复杂问题。